- 월간 방문 수
- 0
- 가격
- 무료 및 유료
- 등록일
- 2026-08-09
- 업데이트됨
- 2026-08-09
01Wan-Animate-2란
Wan-Animate-2는 Wan-Animate 팀이 오픈 소스로 공개한 차세대 캐릭터 애니메이션 모델입니다. Wan-Animate의 대규모 아키텍처 업그레이드 버전으로, 명시적인 포즈 골격과 보조 포즈 추출 네트워크에 대한 의존을 없애고 엔드투엔드 이중 분기 Diffusion Transformer(DiT)로 전환해 참조 영상에서 동작 사전 정보를 직접 포착합니다. 텍스트 기반 시점 제어를 지원하며, 최대 24 fps의 실시간 스트리밍 변형 모델을 제공합니다.
02Wan-Animate-2의 주요 기능
구동 영상의 캐릭터 애니메이션 변환: 참조 이미지 reference.png와 구동 템플릿 영상 template.mp4를 입력하면 참조 캐릭터가 구동 영상의 동작과 카메라 리듬을 재현합니다.
엔드투엔드 동작 전이: 새롭게 설계된 DiT가 구동 영상을 직접 처리하며, 중간 동작 추출기를 거치지 않아 동작 충실도와 정체성 일관성을 동시에 높이는 것을 목표로 합니다.
정체성/외관 유지: reference image token과 reference video token을 어텐션 계산에 활용해 참조 외관을 생성 과정에 주입하고, “동작은 비슷하지만 얼굴이 무너지는” 현상을 줄입니다.
텍스트 정규화 제어: 추론 전에 LLM으로 고정 형식의 caption을 생성하며, “인물 외관 설명 + 배경 설명”만 작성하고 동작이나 감정을 설명하거나 추측하지 않은 뒤 Wan-Animate-2의 prompt로 사용합니다.
텍스트 기반 시점 제어: 텍스트를 사용해 출력 카메라 시점과 구동 영상을 분리할 수 있어 “같은 동작, 다른 카메라 위치/시점”을 쉽게 생성할 수 있습니다.
Base 고품질 모드: 기본 추론 스크립트는 일반 설정을 사용하며, 공식 Diffusers 예시에서는 num_inference_steps=40으로 품질을 우선합니다.
Distillation 저스텝 모드: 증류 가중치 예시는 10 steps, guidance_scale=1.0, Euler solver/no CFG를 사용해 빠른 결과 생성과 저지연 검증을 지향합니다.
실시간화 선행 기능: 논문에서는 teacher forcing, error buffer, Self-Forcing 증류 및 chunk-wise 역전파를 사용하는 Wan-Animate-2-Lite를 제안해 지연 시간을 실시간 임계값에 가깝게 줄이고 스트리밍 캐릭터 애니메이션을 지원합니다.
로컬 및 온라인 체험: 로컬 Gradio 스크립트를 제공하며, Base에는 wan_animate_2_gradio.py, 증류 버전에는 wan_animate_2_gradio_distillation.py를 사용합니다. README에서는 ModelScope Studio 온라인 demo도 안내합니다.
엔지니어링 생태계 진입점: 가중치는 HuggingFace/ModelScope에서 제공되며, 모델 ID 예시는 Wan-AI/Wan2.2-Animate-2-14B입니다. Diffusers는 소스 설치 방식으로 연동할 수 있고, ComfyUI/DiffSynth-Studio는 아직 Todo 상태입니다.
구성 가능한 병렬 생성: 기본 설정은 8×A800, 720P 기준으로 조정되어 있으며 2×A800, 480P도 테스트되었습니다. 하드웨어가 다르면 YAML 병렬 설정을 수정해야 합니다.
03Wan-Animate-2 사용 방법
WeChat에서 팔로우 후 “开源”로 답장하여 AI 오픈 소스 프로젝트交流群에 참여합니다.
하드웨어 준비: 우선 공식 기본 설정인 8×A800, 720P를 기준으로 계획합니다. 공식적으로 2×A800, 480P도 테스트했지만, 소비자용 단일 GPU에서 실행된다고 가정해서는 안 됩니다.
저장소 클론: git clone --recursive https://github.com/Wan-Video/Wan-Animate-2.git.
환경 구축: Python 3.11을 사용합니다. torch 2.7.0 / torchvision 0.22.0 / torchaudio 2.7.0을 CUDA 12.6 소스와 함께 설치한 뒤 requirements.txt와 flash-attn을 설치하고, 마지막으로 pip install -e .를 실행합니다.
가중치 다운로드: HuggingFace는 huggingface-cli download Wan-AI/Wan2.2-Animate-2-14B --local-dir ./ckpts/를 사용하고, ModelScope는 modelscope download --model Wan-AI/Wan2.2-Animate-2-14B --local_dir ./ckpts/를 사용합니다.
먼저 caption 생성: Qwen3.7-Plus와 같은 LLM을 사용해 공식 중국어 형식에 따라 “인물 외관 설명 + 배경 설명”만 작성하고 동작, 감정 또는 평가를 포함하지 않습니다.
Base 실행: infer 디렉터리로 이동한 뒤 wan_animate_2_demo.py를 실행하고 --prompt, --refer-img-file, --refer-video-file, --config ./wan_animate_2.yaml을 전달합니다.
증류 버전 실행: wan_animate_2_distillation.yaml로 변경하고 --sample_guide_scale 1.0 --step 10을 추가합니다. Diffusers에서는 guidance_scale=1.0, flow_solver="euler"에 해당합니다.
병렬 설정 수정: GPU 수나 VRAM이 공식 설정과 다르면 먼저 YAML parallel configs를 수정한 뒤 OOM 또는 속도 이상을 점검합니다.
빠른 체험: 직접 배포하고 싶지 않다면 먼저 ModelScope Studio를 사용해 볼 수 있습니다. 로컬에서는 wan_animate_2_gradio.py 또는 wan_animate_2_gradio_distillation.py를 실행합니다.
04Wan-Animate-2의 핵심 장점
동작 충실도와 정체성 일관성이 핵심 강점입니다. 중간 동작 추출기를 제거해 이론적으로 오차 누적 단계를 줄였습니다.
제작 파이프라인에 더욱 적합: 공식적으로 caption을 고정 형식으로 사전 지정하고, 인물 외관과 배경은 설명하되 동작은 설명하지 않도록 요구해 안정적인 재현이 가능합니다.
저지연 경로가 명확함: Distillation은 이미 10스텝 추론을 지원하며, Lite 논문은 실시간/스트리밍 디지털 휴먼을 직접 목표로 합니다.
상업적 활용 친화도가 높음: Apache-2.0은 2차 개발에 더욱 유리하지만, 실제 상업적 이용 시에는 소재 저작권, 초상권 및 플랫폼 규정을 처리해야 합니다.
05Wan-Animate-2 프로젝트 주소
프로젝트 공식 웹사이트:https://humanaigc.github.io/wan-animate-2
Github 저장소:https://github.com/Wan-Video/Wan-Animate-2
ModelScope:https://modelscope.cn/models/Wan-AI/Wan2.2-Animate-2-14B
arXiv 기술 논문:https://arxiv.org/pdf/2608.06009
온라인 체험 Demo:https://www.modelscope.cn/studios/Wan-AI/Wan2.2-Animate
06Wan-Animate-2의 활용 시나리오
버추얼 스트리머 / 디지털 휴먼 라이브 방송: Lite 경로는 실시간 임계값과 스트리밍 캐릭터 애니메이션을 명확히 목표로 하며, “실제 인물이 가상 캐릭터를 구동하는” 저지연 라이브 방송에 적합합니다.
숏폼 영상 / 숏드라마 캐릭터 대역: 배우의 연기 영상을 driving video로 사용해 캐릭터 일러스트나 참조 이미지에 적용할 수 있어 판타지 캐릭터, IP 캐릭터, 저비용 대역 장면에 적합합니다. 핵심은 엔드투엔드 동작 전이와 정체성 유지입니다.
댄스, MV, 손동작 댄스 2차 창작: 하나의 댄스 템플릿으로 다양한 캐릭터를 구동해 여러 캐릭터의 커버 댄스, 같은 화면에서의 의상 교체 또는 스타일화된 MV를 제작할 수 있습니다. 시점 제어를 활용하면 “같은 동작, 다른 카메라 위치”의 편집 소재도 만들 수 있습니다.
전자상거래 및 브랜드 콘텐츠: 브랜드 mascot이나 가상 모델이 통일된 템플릿에 따라 동작을 선보이도록 해 신상품 숏폼, 이벤트 페이지 영상, 소셜 미디어 소재에 활용할 수 있습니다. 상업적으로 사용하기 전 초상권, 의상 저작권 및 플랫폼 규정을 처리해야 합니다.
교육 / 지식 크리에이터 강의 자료: 강사 이미지나 캐릭터 강사를 고정 동작 템플릿으로 구동해 오프닝, 장면 전환, 지식 포인트 안내 장면을 대량으로 생성하고 반복 촬영 비용을 줄일 수 있습니다.
게임 NPC / 컷신 사전 시각화: 기획자가 먼저 실제 인물의 연기로 캐릭터 프로토타입을 빠르게 구동해 동작 리듬, 카메라와 감정을 검증한 뒤 정식 모션 캡처 및 렌더링 파이프라인 진행 여부를 결정할 수 있습니다.
© 면책 조항: 도메인 및 연결된 콘텐츠는 시간이 지나면서 변경될 수 있습니다. AIEZZ은(는) 제3자 웹사이트를 관리하지 않습니다. 외부 콘텐츠와 위험을 독립적으로 검토하세요.


사용자 리뷰0