Wan Animate 2 튜토리얼: Move 모드, Mix 모드 및 ComfyUI 워크플로 가이드

E
Emma Chen·6분 읽기·Aug 19, 2026
X에 공유
Wan Animate 2 튜토리얼: Move 모드, Mix 모드 및 ComfyUI 워크플로 가이드

AI 개요

Wan Animate 2란 무엇이며, 어떤 기능을 제공하나요?

Wan Animate 2는 Wan 2.2 기반으로 구축된 오픈소스 캐릭터 애니메이션 시스템입니다. 이 시스템은 드라이버 동영상에서 전신 동작, 표정, 입 움직임을 추출하여 Move 또는 Mix 모드를 통해 참조 캐릭터에 전달합니다.

Wan Animate 2에서 Move 모드와 Mix 모드의 차이점은 무엇인가요?

Move 모드는 정지된 캐릭터를 애니메이션화하며, 주변 배경을 모델이 새로 생성합니다. Mix 모드는 드라이버 동영상 내 인물을 교체하면서 원본 장면, 배경, 오디오를 그대로 유지합니다.

ComfyUI에서 로컬로 Wan Animate 2를 실행할 수 있나요?

네. 이 워크플로는 Wan 2.2 Animate 가중치, WanVideoAnimateEmbeds, 샘플러, VAE를 사용합니다. 메모리 여유가 있다면 bf16을 선택하고, 경량 로컬 설정이 필요할 경우 int8-convrot를 사용하세요.

직접 해볼 준비가 되셨나요?

가입 시 무료 크레딧 제공. 요금제는 월 $20부터.

Seedance 무료로 사용해보기

Wan Animate 2는 어떤 입력을 요구하나요?

두 모드 모두 참조 이미지와 드라이버 동영상이 필요합니다. 신뢰성 있는 얼굴 크롭은 정체성 일관성을 향상시킵니다. Mix 모드의 경우, 깨끗한 배경 프레임과 견고한 SAM2 인물 마스크도 유용합니다.

Wan Animate 2가 실제로 수행하는 작업 — 그리고 왜 다른가?

일반적인 이미지-동영상 모델은 정지 이미지와 프롬프트로부터 동작을 ‘창조’합니다. 반면 Wan Animate 2는 실제 공연을 구조화된 지침으로 간주합니다: 드라이버는 자세, 타이밍, 표정, 입 움직임을 제공하고, 참조 이미지는 캐릭터 정체성을 제공합니다. 따라서 외형만큼 공연 자체가 중요한 상황에서 특히 유용합니다.

이는 또한 엔드포인트 제어 방식의 생성과도 다릅니다. 첫 프레임과 마지막 프레임을 지정하는 워크플로는 촬영 시작과 종료 위치만 정의하지만, 그 사이의 모든 동작을 재현하지는 않습니다. 공연 전달보다 목적 프레임이 더 중요한 경우, MiniMax H3 첫 프레임-마지막 프레임 가이드를 참고하세요.

공식 Wan Animate 2 · 참조, 드라이버, 생성된 공연

이 삼단 구성 클립은 정지된 참조 이미지, 드라이빙 공연, 생성 결과를 동시에 보여줍니다. 단일 완성 프레임보다 훨씬 유용한 품질 검사 도구인데, 제스처 타이밍과 정체성을 직접 비교할 수 있기 때문입니다.

Move 모드 대 Mix 모드 — 올바른 모드 선택하기

두 모드 모두 공연을 전달하지만, 서로 다른 제작 문제를 해결합니다. 마스크 제작이나 추가 프레임 준비 전에 다음 결정표를 활용하세요:

결정 요소 Move 모드 Mix 모드
입력 참조 이미지 + 드라이버 동영상 참조 이미지 + 드라이버 동영상
배경 모델이 재생성 원본 동영상 배경 유지
최적 용도 캐릭터 액션 및 이미지 애니메이션 기존 장면 내 인물 교체
한 줄 요약 규칙 “이미지를 움직이게 하기” “동영상 내 인물 교체하기”

캐릭터와 동작이 창의적 핵심이며 환경이 변경될 수 있을 때는 Move 모드를 선택하세요. 블로킹, 소품, 조명, 카메라 움직임, 사운드 등이 이미 원본 클립에서 잘 작동할 때는 Mix 모드를 선택하세요. 브라우저 기반으로 동일한 아이디어를 먼저 시도해 보려면, 로컬 그래프 구축 전에 모션 제어 워크플로를 참고하세요.

공식 Wan Animate 2 · 스타일화된 캐릭터 동작 전달

이 예시는 실루엣과 신체 비율이 얼마나 중요한지를 보여줍니다. 드라이버와 캐릭터가 외형적으로 완전히 달라 보일 수 있지만, 참조 이미지에 명확한 전신 포즈가 있고 드라이버가 프레임 내에 안정적으로 유지된다면 결과물은 여전히 명확하게 인식됩니다.

시작 전 준비 사항 — 입력 자산 및 모델 파일

ComfyUI를 열기 전에 자산을 준비하세요. 깨끗한 입력 세트는 나중에 샘플링 단계를 추가하는 것보다 훨씬 더 많은 실패를 방지합니다.

  • 드라이버 동영상: 하나의 명확한 피사체, 안정적인 프레이밍, 선명한 사지, 의도적인 표정 변화를 포함해야 합니다. 내보내기 전에 불필요한 시간(데드 타임)을 잘라내세요.
  • 참조 이미지: 선명한 전신 또는 3/4 각도 캐릭터 이미지로, 손과 발이 보이고 얼굴이 가리지 않아야 합니다.
  • 얼굴 크롭: 참조 및 드라이버 얼굴의 근접 크롭으로, 정체성 및 표정 정렬 강화에 사용합니다.
  • Mix 모드용 SAM2 마스크: 머리카락, 손, 움직이는 옷 주변에 구멍이 없는 견고한 인물 마스크입니다.
  • Mix 모드용 배경 프레임: 원본 촬영에서 얻은 깨끗한 배경 이미지; 교체된 배우가 이전에 가려졌던 영역을 노출할 때마다 이를 활용하세요.
  • Wan 2.2 Animate 가중치: bf16은 가장 깨끗한 전체 정밀도 경로를 제공하며, int8-convrot는 메모리 부담을 낮추지만 품질 저하 가능성도 있습니다.

하드웨어 사양, 양자화 방식, 디코딩 시간은 여전히 로컬 경험에 영향을 미칩니다. 로컬 실행 여부를 결정할 때는 LTX 2.5 vs MiniMax H3 비교에서 제시한 고려사항들을 유용한 체크리스트로 활용하세요.

Wan Animate 2 모델 구조: 직접적인 이미지 및 동영상 조건부 처리

공식 아키텍처 다이어그램은 참조 이미지, 참조 동영상, 대상 동영상 토큰이 애니메이션 파이프라인에 어떻게 입력되는지를 보여줍니다.

단계별 ComfyUI 워크플로1. Wan 2.2 Animate 가중치를 로드합니다. VRAM이 허용하는 경우 품질을 위해 bf16을 선택하거나, 경량화된 그래프를 원할 경우 int8-convrot 빌드를 사용하세요. VAE 및 텍스트 인코더가 워크플로우와 일치하는지 확인하세요.

  1. WanVideoAnimateEmbeds를 연결합니다. 참조 신원(reference identity), 드라이버 포즈 시퀀스(driver pose sequence), 얼굴 크롭(face crops), SAM2 마스크를 입력으로 제공하세요. Mix 모드는 원본 배경이 교체 과정에서 살아남아야 하므로 가장 깨끗한 마스크가 필요합니다.
  2. 드라이버 차원과 일치시킵니다. 너비(width), 높이(height), num_frames를 준비된 드라이버 비디오와 정확히 일치시킵니다. 16의 배수인 해상도를 사용하고, 먼저 짧은 구간을 테스트하세요.
  3. WanVideoSampler를 구성합니다. 직접적인 장면 프롬프트(direct scene prompt), 호환 가능한 LoRA, 샘플러(sampler), 스케줄러(scheduler), 시드(seed), 스텝 수(step count)를 추가하세요. 프롬프트는 드라이버의 동작과 충돌하지 않도록 외형(appearance)과 환경(environment)을 묘사해야 합니다.
  4. Mix 또는 Move 중 하나를 선택합니다. 원본 장면 및 배경 프레임과 함께 Mix를 사용하고, 애니메이션된 참조 주변에 환경을 재구성해야 할 경우 Move를 사용하세요.
  5. 디코딩 및 저장합니다. 최초 결과물을 전체 크기로 검토한 후, 드라이버와 비교하여 얼굴, 손가락, 마스크 경계선, 바닥 접촉, 입술 타이밍(lip timing)을 점검하세요. 이후 지속 시간(duration) 또는 해상도(resolution)를 증가시키세요.

모델 설치 없이 캐릭터 및 프레이밍을 검증하려면, 참조 영상 생성기(reference-to-video generator)로 시작한 후 승인된 입력 쌍을 ComfyUI로 이어가세요.

더 나은 결과 얻기 — 일반적인 해결책 및 팁

  • 배경 드리프트(Background drift): Mix 모드에서는 깨끗한 배경 프레임을 제공하고, 단단한 SAM2 마스크를 사용하세요. 과도한 피더링(feathering)은 배우 주변에 후광(halo)을 유발할 수 있습니다.
  • 얼굴 드리프트(Face drift): 선명한 얼굴 크롭, 균일한 조명, 드라이버와 유사한 각도의 참조 이미지를 사용하세요. 첫 번째 테스트 시 손이 얼굴을 가리는 상황은 피하세요.
  • 해상도 불일치(Resolution mismatch): 너비, 높이, num_frames를 드라이버와 정확히 일치시켜야 합니다. 여러 노드에서 리사이징하기보다는 그래프 진입 전에 한 번만 리사이징하세요.
  • 부자연스러운 입술(Unnatural lips): 입이 잘 보이는 드라이버를 선택하고, 명확한 음절 발음과 제한된 모션 블러(motion blur)를 고려하세요. 극단적인 프로필 각도는 입술 디테일 활용도를 낮춥니다.
  • 느린 반복(Slow iteration): 호환 가능한 lightx2v 스텝-증류(stepping-distillation) LoRA를 적용하고, 짧은 클립으로 시작하세요. 테스트에는 적은 스텝 수가 유용하지만, 최종 실행 결과는 항상 증류되지 않은 기준선(baseline)과 비교해야 합니다.

한 번에 하나의 변수만 변경하세요. 고정된 시드, 짧은 드라이버 구간, 저장된 입력 세트를 사용하면 매 반복이 새로운 실험이 아니라 유용한 비교가 됩니다.

사용 사례 — Wan Animate 2로 구현 가능한 것들

  1. AI 호스트 또는 디지털 인간 — Move: 세트(set)를 호스트 주변에서 재생성할 수 있을 때, 녹화된 공연에서 깨끗한 발표자 초상화를 애니메이션합니다.
  2. 이커머스 모델 교체 — Mix: 제품 연출(product staging) 및 카메라 움직임을 유지하면서, 공연자를 캠페인 캐릭터로 교체합니다.
  3. 맞춤 IP 애니메이션 — Move: 인간의 제스처 및 표정 타이밍을 마스코트, 일러스트, 또는 스타일화된 3D 캐릭터로 전이합니다.
  4. UGC 댄스 및 액션 — Move: 키포즈(key poses)를 수작업으로 애니메이션하지 않고, 하나의 승인된 이미지를 동작 중심의 소셜 클립으로 변환합니다.
  5. 대량 광고 캐릭터 교체 — Mix: 동일한 편집, 위치, 소품, 오디오를 유지하면서 화면 내 인재(talent)를 여러 변형으로 맞춤화합니다.

반복적으로 사용되는 브랜드 캐릭터의 경우, 무작위 영상 추가보다 데이터셋의 일관성이 더 중요합니다. 당사의 MiniMax H3 LoRA 훈련 가이드에서 소개한 준비 및 검증 관행은 맞춤 애니메이션 프로젝트에도 잘 적용됩니다.

결론

가장 간단한 규칙은 Move = 이미지 애니메이션, Mix = 비디오 내 인물 교체입니다. 깨끗한 참조 이미지와 짧은 드라이버로 시작하고, 차원과 마스크를 고정한 후, 신원 및 동작이 안정된 다음에만 확장하세요. 로컬 가중치 및 노드를 유지하지 않고 동일한 참조 기반 워크플로우를 원한다면, Seedance에서 다음 AI 비디오를 만들어 보세요 →.

직접 해볼 준비가 되셨나요?

이 가이드의 단계를 Seedance에서 바로 적용해 프롬프트나 이미지를 몇 분 안에 완성도 높은 영상으로 바꿔보세요.

가입 시 무료 크레딧 제공. 요금제는 월 $20부터.