Руководство по Wan Animate 2: режим Move, режим Mix и рабочий процесс в ComfyUI

E
Emma Chen·7 мин чтения·Aug 19, 2026
Поделиться в X
Руководство по Wan Animate 2: режим Move, режим Mix и рабочий процесс в ComfyUI

Обзор ИИ

Что такое Wan Animate 2 и что он умеет делать?

Wan Animate 2 — это открытая система анимации персонажей, построенная на базе Wan 2.2. Она переносит движение всего тела, мимику лица и движения губ с управляющего видео на эталонного персонажа в режимах Move или Mix.

В чём разница между режимами Move и Mix в Wan Animate 2?

Move анимирует неподвижное изображение персонажа и позволяет модели сгенерировать окружающий фон. Mix заменяет человека в управляющем видео, сохраняя при этом исходную сцену, фон и звук.

Можно ли запустить Wan Animate 2 локально в ComfyUI?

Да. Рабочий процесс использует веса Wan 2.2 Animate, WanVideoAnimateEmbeds, сэмплер и VAE. Выберите формат bf16, если позволяет объём памяти, или int8-convrot — для более лёгкой локальной конфигурации.

Готовы попробовать сами?

Бесплатные кредиты при регистрации. Тарифы от $20 в месяц.

Попробовать Seedance бесплатно

Какие входные данные требуются для Wan Animate 2?

Оба режима требуют эталонное изображение и управляющее видео. Надёжные обрезки лиц повышают точность передачи идентичности; режим Mix дополнительно выигрывает от кадров с чистым фоном и качественной маски SAM2 для человека.

Что на самом деле делает Wan Animate 2 — и чем он отличается

Обычные модели «изображение → видео» генерируют движение из статичного изображения и текстового промпта. Wan Animate 2 же рассматривает реальное выступление как структурированное руководство: управляющее видео задаёт позу, ритм, мимику и движения рта, а эталонное изображение определяет идентичность персонажа. Это делает его полезным в тех случаях, когда важны не только внешний вид, но и качество исполнения.

Это также отличается от генерации с контролем по конечным кадрам. Рабочий процесс «первый и последний кадр» определяет, с чего и на чём заканчивается кадр, но не воспроизводит каждое промежуточное действие между ними. См. руководство MiniMax H3 по первому и последнему кадру, если важнее конечный кадр, чем точная передача выступления.

Официальный Wan Animate 2 · эталонное изображение, управляющее видео и сгенерированное выступление

Трёхпанельный клип одновременно показывает неподвижное эталонное изображение, управляющее выступление и сгенерированный результат. Такой способ проверки качества полезнее, чем один отполированный кадр, поскольку позволяет напрямую сравнивать ритм жестов и идентичность.

Режим Move против режима Mix — как выбрать подходящий

Оба режима передают выступление, но решают разные производственные задачи. Используйте эту таблицу решений до создания масок или подготовки дополнительных кадров:

Решение Режим Move Режим Mix
Входные данные Эталонное изображение + управляющее видео Эталонное изображение + управляющее видео
Фон Генерируется моделью Оригинальный фон видео сохраняется
Лучшее применение Анимация действий персонажа и изображения Замена человека внутри существующей сцены
Краткое правило «Заставить изображение двигаться» «Заменить человека в видео»»

Выбирайте Move, когда персонаж и его движения являются творческим ядром, а окружение может меняться. Выбирайте Mix, когда компоновка, реквизит, освещение, движение камеры и звук уже работают в исходном клипе. Для браузерной версии той же идеи попробуйте рабочий процесс управления движением перед тем, как переходить к локальному графу.

Официальный Wan Animate 2 · перенос стилизованного движения персонажа

Этот пример демонстрирует, почему важны силуэт и пропорции тела. Драйвер и персонаж могут выглядеть совершенно по-разному, однако результат остаётся читаемым, если эталонное изображение содержит чёткую позу всего тела, а драйвер остаётся в кадре.

Что нужно подготовить перед началом — входные данные и файлы моделей

Подготовьте ресурсы до открытия ComfyUI. Чистый набор входных данных предотвращает больше сбоев, чем добавление шагов сэмплирования на более поздних этапах.

  • Управляющее видео: один чётко видимый объект, стабильная компоновка кадра, чётко различимые конечности и осознанные движения лица. Удалите «мёртвое» время перед экспортом.
  • Эталонное изображение: резкое изображение всего тела или в три четверти с видимыми руками, ногами и неперекрытым лицом.
  • Обрезки лиц: крупные обрезки лиц эталонного и управляющего изображений для более точного совпадения идентичности и мимики.
  • Маска SAM2 для режима Mix: надёжная маска человека без пробелов вокруг волос, рук или подвижной одежды.
  • Кадры фона для режима Mix: «чистые» кадры из оригинального съёмочного материала; используйте их каждый раз, когда заменяемый актёр открывает ранее скрытые области.
  • Веса Wan 2.2 Animate: формат bf16 обеспечивает наиболее чистый путь полной точности; int8-convrot снижает нагрузку на память с возможной потерей качества.

Аппаратные возможности, квантование и время декодирования по-прежнему влияют на локальный опыт. Компромиссы, описанные в нашем сравнении LTX 2.5 и MiniMax H3, служат полезным чек-листом при принятии решения — запускать ли процесс локально или использовать облачный рабочий процесс.

Структура модели Wan Animate 2 с прямой условной обработкой изображения и видео

Официальная архитектурная диаграмма показывает, как токены эталонного изображения, эталонного видео и целевого видео поступают в конвейер анимации.

Пошаговый рабочий процесс в ComfyUI1. Загрузите веса Wan 2.2 Animate. Выберите формат bf16 для максимального качества при достаточном объёме видеопамяти (VRAM), либо сборку int8-convrot — для более лёгкого графа. Убедитесь, что VAE и текстовый энкодер соответствуют данному рабочему процессу.

  1. Подключите узел WanVideoAnimateEmbeds. Передайте ему: референсную идентичность, последовательность поз водителя (driver), вырезанные фрагменты лица и маску SAM2. Режим Mix требует наиболее чистой маски, поскольку исходный фон должен остаться нетронутым после замены.
  2. Согласуйте размеры водителя. Установите параметры width, height и num_frames в соответствии с подготовленным видео водителя. Используйте разрешения, кратные 16, и протестируйте сначала короткий фрагмент.
  3. Настройте WanVideoSampler. Укажите прямой промпт сцены, совместимый LoRA (при наличии), сэмплер, планировщик (scheduler), seed и количество шагов. Промпт должен описывать внешность и окружение, а не противоречить действиям водителя.
  4. Выберите режим Mix или Move. В режиме Mix подавайте на вход оригинальные кадры сцены и фона; в режиме Move модель должна полностью перестроить окружение вокруг анимированной референсной фигуры.
  5. Декодируйте и сохраните результат. Проверьте первый результат в полном разрешении, затем сравните лицо, пальцы, края маски, контакт с полом и синхронизацию губ с движениями водителя — до увеличения продолжительности или разрешения.

Если вы хотите проверить персонажа и компоновку без установки моделей, начните с генератора «референс → видео», а затем передайте одобренную пару входных данных в ComfyUI.

Как добиться лучших результатов — типичные исправления и советы

  • Смещение фона: в режиме Mix предоставляйте чистые кадры фона и используйте чёткую маску SAM2. Слишком агрессивное размытие краёв маски может вызвать появление ореола вокруг актёра.
  • Смещение лица: используйте резкие вырезки лица, равномерное освещение и референсный ракурс, близкий к ракурсу водителя. Во время первого теста избегайте закрытия лица руками.
  • Несоответствие разрешений: значения width, height и num_frames должны точно совпадать с параметрами видео водителя. Изменяйте размер один раз — до входа в граф, а не на нескольких узлах.
  • Неестественные губы: выбирайте водителя с хорошо видимым ртом, чёткими слогами и минимальным размытием движения. Экстремальные профильные ракурсы снижают количество полезной детализации губ.
  • Медленная итерация: примените совместимый LoRA типа lightx2v с дистилляцией по шагам и начните с короткого клипа. Меньшее число шагов ценно для тестов, но всегда сравнивайте финальный результат с базовой версией без дистилляции.

Изменяйте только одну переменную за раз. Фиксированный seed, короткий сегмент водителя и сохранённый набор входных данных превращают каждую новую попытку в содержательное сравнение, а не в отдельный эксперимент.

Сценарии использования — что можно создать с Wan Animate 2

  1. AI-ведущий или цифровой человек — Move: анимируйте чистый портрет спикера, записанный во время выступления, когда декорацию можно регенерировать вокруг ведущего.
  2. Замена модели в e-commerce — Mix: сохраните оформление продукта и движение камеры, заменив исполнителя на персонажа рекламной кампании.
  3. Анимация собственного IP — Move: перенесите человеческие жесты и тайминг мимики на маскота, иллюстрацию или стилизованного 3D-персонажа.
  4. UGC-танцы и действия — Move: превратите одно одобренное изображение в социальный клип, управляемый движением, без ручной анимации ключевых поз.
  5. Пакетная замена персонажей в рекламе — Mix: сохраните один и тот же монтаж, локацию, реквизит и аудио, адаптируя экранный талант для нескольких вариантов.

Для повторно используемых брендовых персонажей согласованность датасета важнее добавления случайных видеоматериалов. Подходы к подготовке и валидации, описанные в нашем руководстве по обучению LoRA для MiniMax H3, хорошо применимы и к проектам пользовательской анимации.

Заключение

Самое простое правило: Move = анимировать изображение; Mix = заменить человека в видео. Начните с чистого референса и короткого видео водителя, зафиксируйте размеры и маски, а масштабирование применяйте только после того, как идентичность и движение станут стабильными. Если вы хотите использовать тот же референс-ориентированный рабочий процесс, не устанавливая локальные веса и узлы, создайте своё следующее AI-видео на Seedance →.

Готовы попробовать сами?

Примените шаги из этого руководства в Seedance и превратите промпты или изображения в готовые видео за считанные минуты.

Бесплатные кредиты при регистрации. Тарифы от $20 в месяц.

Похожие статьи

Еще материалы на этом же языке, которые стоит прочитать дальше.