- Блог
- Руководство по Wan Animate 2: режим Move, режим Mix и рабочий процесс в ComfyUI
Руководство по Wan Animate 2: режим Move, режим Mix и рабочий процесс в ComfyUI

Обзор ИИ
Что такое Wan Animate 2 и что он умеет делать?
Wan Animate 2 — это открытая система анимации персонажей, построенная на базе Wan 2.2. Она переносит движение всего тела, мимику лица и движения губ с управляющего видео на эталонного персонажа в режимах Move или Mix.
В чём разница между режимами Move и Mix в Wan Animate 2?
Move анимирует неподвижное изображение персонажа и позволяет модели сгенерировать окружающий фон. Mix заменяет человека в управляющем видео, сохраняя при этом исходную сцену, фон и звук.
Можно ли запустить Wan Animate 2 локально в ComfyUI?
Да. Рабочий процесс использует веса Wan 2.2 Animate, WanVideoAnimateEmbeds, сэмплер и VAE. Выберите формат bf16, если позволяет объём памяти, или int8-convrot — для более лёгкой локальной конфигурации.
Готовы попробовать сами?
Бесплатные кредиты при регистрации. Тарифы от $20 в месяц.
Какие входные данные требуются для Wan Animate 2?
Оба режима требуют эталонное изображение и управляющее видео. Надёжные обрезки лиц повышают точность передачи идентичности; режим Mix дополнительно выигрывает от кадров с чистым фоном и качественной маски SAM2 для человека.
Что на самом деле делает Wan Animate 2 — и чем он отличается
Обычные модели «изображение → видео» генерируют движение из статичного изображения и текстового промпта. Wan Animate 2 же рассматривает реальное выступление как структурированное руководство: управляющее видео задаёт позу, ритм, мимику и движения рта, а эталонное изображение определяет идентичность персонажа. Это делает его полезным в тех случаях, когда важны не только внешний вид, но и качество исполнения.
Это также отличается от генерации с контролем по конечным кадрам. Рабочий процесс «первый и последний кадр» определяет, с чего и на чём заканчивается кадр, но не воспроизводит каждое промежуточное действие между ними. См. руководство MiniMax H3 по первому и последнему кадру, если важнее конечный кадр, чем точная передача выступления.
Трёхпанельный клип одновременно показывает неподвижное эталонное изображение, управляющее выступление и сгенерированный результат. Такой способ проверки качества полезнее, чем один отполированный кадр, поскольку позволяет напрямую сравнивать ритм жестов и идентичность.
Режим Move против режима Mix — как выбрать подходящий
Оба режима передают выступление, но решают разные производственные задачи. Используйте эту таблицу решений до создания масок или подготовки дополнительных кадров:
| Решение | Режим Move | Режим Mix |
|---|---|---|
| Входные данные | Эталонное изображение + управляющее видео | Эталонное изображение + управляющее видео |
| Фон | Генерируется моделью | Оригинальный фон видео сохраняется |
| Лучшее применение | Анимация действий персонажа и изображения | Замена человека внутри существующей сцены |
| Краткое правило | «Заставить изображение двигаться» | «Заменить человека в видео»» |
Выбирайте Move, когда персонаж и его движения являются творческим ядром, а окружение может меняться. Выбирайте Mix, когда компоновка, реквизит, освещение, движение камеры и звук уже работают в исходном клипе. Для браузерной версии той же идеи попробуйте рабочий процесс управления движением перед тем, как переходить к локальному графу.
Этот пример демонстрирует, почему важны силуэт и пропорции тела. Драйвер и персонаж могут выглядеть совершенно по-разному, однако результат остаётся читаемым, если эталонное изображение содержит чёткую позу всего тела, а драйвер остаётся в кадре.
Что нужно подготовить перед началом — входные данные и файлы моделей
Подготовьте ресурсы до открытия ComfyUI. Чистый набор входных данных предотвращает больше сбоев, чем добавление шагов сэмплирования на более поздних этапах.
- Управляющее видео: один чётко видимый объект, стабильная компоновка кадра, чётко различимые конечности и осознанные движения лица. Удалите «мёртвое» время перед экспортом.
- Эталонное изображение: резкое изображение всего тела или в три четверти с видимыми руками, ногами и неперекрытым лицом.
- Обрезки лиц: крупные обрезки лиц эталонного и управляющего изображений для более точного совпадения идентичности и мимики.
- Маска SAM2 для режима Mix: надёжная маска человека без пробелов вокруг волос, рук или подвижной одежды.
- Кадры фона для режима Mix: «чистые» кадры из оригинального съёмочного материала; используйте их каждый раз, когда заменяемый актёр открывает ранее скрытые области.
- Веса Wan 2.2 Animate: формат bf16 обеспечивает наиболее чистый путь полной точности; int8-convrot снижает нагрузку на память с возможной потерей качества.
Аппаратные возможности, квантование и время декодирования по-прежнему влияют на локальный опыт. Компромиссы, описанные в нашем сравнении LTX 2.5 и MiniMax H3, служат полезным чек-листом при принятии решения — запускать ли процесс локально или использовать облачный рабочий процесс.

Официальная архитектурная диаграмма показывает, как токены эталонного изображения, эталонного видео и целевого видео поступают в конвейер анимации.
Пошаговый рабочий процесс в ComfyUI1. Загрузите веса Wan 2.2 Animate. Выберите формат bf16 для максимального качества при достаточном объёме видеопамяти (VRAM), либо сборку int8-convrot — для более лёгкого графа. Убедитесь, что VAE и текстовый энкодер соответствуют данному рабочему процессу.
- Подключите узел
WanVideoAnimateEmbeds. Передайте ему: референсную идентичность, последовательность поз водителя (driver), вырезанные фрагменты лица и маску SAM2. Режим Mix требует наиболее чистой маски, поскольку исходный фон должен остаться нетронутым после замены. - Согласуйте размеры водителя. Установите параметры
width,heightиnum_framesв соответствии с подготовленным видео водителя. Используйте разрешения, кратные 16, и протестируйте сначала короткий фрагмент. - Настройте
WanVideoSampler. Укажите прямой промпт сцены, совместимый LoRA (при наличии), сэмплер, планировщик (scheduler), seed и количество шагов. Промпт должен описывать внешность и окружение, а не противоречить действиям водителя. - Выберите режим Mix или Move. В режиме Mix подавайте на вход оригинальные кадры сцены и фона; в режиме Move модель должна полностью перестроить окружение вокруг анимированной референсной фигуры.
- Декодируйте и сохраните результат. Проверьте первый результат в полном разрешении, затем сравните лицо, пальцы, края маски, контакт с полом и синхронизацию губ с движениями водителя — до увеличения продолжительности или разрешения.
Если вы хотите проверить персонажа и компоновку без установки моделей, начните с генератора «референс → видео», а затем передайте одобренную пару входных данных в ComfyUI.
Как добиться лучших результатов — типичные исправления и советы
- Смещение фона: в режиме Mix предоставляйте чистые кадры фона и используйте чёткую маску SAM2. Слишком агрессивное размытие краёв маски может вызвать появление ореола вокруг актёра.
- Смещение лица: используйте резкие вырезки лица, равномерное освещение и референсный ракурс, близкий к ракурсу водителя. Во время первого теста избегайте закрытия лица руками.
- Несоответствие разрешений: значения
width,heightиnum_framesдолжны точно совпадать с параметрами видео водителя. Изменяйте размер один раз — до входа в граф, а не на нескольких узлах. - Неестественные губы: выбирайте водителя с хорошо видимым ртом, чёткими слогами и минимальным размытием движения. Экстремальные профильные ракурсы снижают количество полезной детализации губ.
- Медленная итерация: примените совместимый LoRA типа lightx2v с дистилляцией по шагам и начните с короткого клипа. Меньшее число шагов ценно для тестов, но всегда сравнивайте финальный результат с базовой версией без дистилляции.
Изменяйте только одну переменную за раз. Фиксированный seed, короткий сегмент водителя и сохранённый набор входных данных превращают каждую новую попытку в содержательное сравнение, а не в отдельный эксперимент.
Сценарии использования — что можно создать с Wan Animate 2
- AI-ведущий или цифровой человек — Move: анимируйте чистый портрет спикера, записанный во время выступления, когда декорацию можно регенерировать вокруг ведущего.
- Замена модели в e-commerce — Mix: сохраните оформление продукта и движение камеры, заменив исполнителя на персонажа рекламной кампании.
- Анимация собственного IP — Move: перенесите человеческие жесты и тайминг мимики на маскота, иллюстрацию или стилизованного 3D-персонажа.
- UGC-танцы и действия — Move: превратите одно одобренное изображение в социальный клип, управляемый движением, без ручной анимации ключевых поз.
- Пакетная замена персонажей в рекламе — Mix: сохраните один и тот же монтаж, локацию, реквизит и аудио, адаптируя экранный талант для нескольких вариантов.
Для повторно используемых брендовых персонажей согласованность датасета важнее добавления случайных видеоматериалов. Подходы к подготовке и валидации, описанные в нашем руководстве по обучению LoRA для MiniMax H3, хорошо применимы и к проектам пользовательской анимации.
Заключение
Самое простое правило: Move = анимировать изображение; Mix = заменить человека в видео. Начните с чистого референса и короткого видео водителя, зафиксируйте размеры и маски, а масштабирование применяйте только после того, как идентичность и движение станут стабильными. Если вы хотите использовать тот же референс-ориентированный рабочий процесс, не устанавливая локальные веса и узлы, создайте своё следующее AI-видео на Seedance →.
Готовы попробовать сами?
Примените шаги из этого руководства в Seedance и превратите промпты или изображения в готовые видео за считанные минуты.
Бесплатные кредиты при регистрации. Тарифы от $20 в месяц.
Похожие статьи
Еще материалы на этом же языке, которые стоит прочитать дальше.

Обзор LTX 2.5: скорость, многокадровая генерация и сравнение с MiniMax H3
Честный обзор LTX 2.5: скорость работы, нативная многокадровая видеогенерация, настройка в ComfyUI, открытые веса, качество изображения и прямое сравнение с MiniMax H3.
Читать статью
MiniMax H3: 30 против 50 шагов — что действительно меняется в качестве и скорости
Сравнение MiniMax H3 при 20, 30 и 50 шагах по детализации изображения, времени генерации, качеству аудио, скорости Turbo LoRA и выбору оптимальных настроек для каждого рабочего процесса.
Читать статью
Лучшие настройки MiniMax H3 для качества, скорости и аудио в 2026 году
Используйте лучшие настройки MiniMax H3 для разрешения, количества шагов, сэмплера, планировщика, guidance, аудио и каждого режима генерации H3 в ComfyUI или в облаке.
Читать статью