Wan Animate 2 教程:Move 模式、Mix 模式与 ComfyUI 工作流指南

E
Emma Chen·阅读约 2 分钟·Aug 19, 2026
分享到 X
Wan Animate 2 教程:Move 模式、Mix 模式与 ComfyUI 工作流指南

AI 概览

什么是 Wan Animate 2?它能做什么?

Wan Animate 2 是一个基于 Wan 2.2 构建的开源角色动画系统。它通过 Move 模式或 Mix 模式,将驱动视频中的全身动作、面部表情及口型运动迁移至参考角色。

Wan Animate 2 中 Move 模式与 Mix 模式有何区别?

Move 模式对静态角色进行动画化,并由模型生成周围背景。Mix 模式则在保留原始场景、背景和音频的前提下,替换驱动视频中的人物。

我能否在本地 ComfyUI 中运行 Wan Animate 2?

可以。该工作流使用 Wan 2.2 Animate 权重、WanVideoAnimateEmbeds、采样器及 VAE。若显存允许,请选择 bf16 精度;如需更轻量的本地配置,可选用 int8-convrot 量化方案。

准备好亲自试试了吗?

注册即送免费积分,套餐每月 $20 起。

免费试用 Seedance

Wan Animate 2 需要哪些输入?

两种模式均需参考图像与驱动视频。稳定可靠的人脸裁剪可提升身份一致性;Mix 模式还额外受益于干净的背景帧以及高质量的 SAM2 人物遮罩。

Wan Animate 2 实际所做之事——及其独特之处

普通图像转视频模型仅依据一张静态图与文本提示“发明”运动。而 Wan Animate 2 则将真实表演视为结构化引导:驱动视频提供姿态、节奏、面部表情与口型运动,参考图像则提供角色身份。因此,当表演本身的重要性不亚于视觉外观时,该系统尤为适用。

这也不同于端点控制式生成(endpoint-controlled generation)。首帧+末帧工作流仅定义镜头起止位置,但无法复现其间所有关键动作节拍。当目标帧比表演迁移更重要时,请参阅 MiniMax H3 首帧与末帧指南

官方 Wan Animate 2 · 参考图、驱动视频与生成结果对比

该三联画面同时显示静态参考图、驱动表演及生成结果,是一种比单张精修帧更有价值的质量检查方式,因为你可直接比对肢体动作节奏与角色身份一致性。

Move 模式 vs Mix 模式——如何选择合适模式

两种模式均实现表演迁移,但解决的是不同制作问题。请在构建遮罩或准备额外帧前,先参考下表决策:

决策维度 Move 模式 Mix 模式
输入要求 参考图像 + 驱动视频 参考图像 + 驱动视频
背景处理 由模型重新生成 保留原始视频背景
最佳适用场景 角色动作与图像动画 在既有场景中替换人物
一句话准则 “让画面动起来” “替换视频中的人物”

当角色与动作是创意核心、且环境允许变化时,请选择 Move 模式;当布景、道具、灯光、摄像机运动及声音已在源片段中完成良好设计时,请选择 Mix 模式。若希望先在浏览器中快速验证相同理念,可在投入本地图构建前,尝试 运动控制工作流

官方 Wan Animate 2 · 风格化角色动作迁移

本例说明了剪影与身体比例为何至关重要:即使驱动者与角色外观迥异,只要参考图具备清晰的全身姿态、且驱动者始终处于画面内,最终结果仍具高度可读性。

开始前必备事项——输入素材与模型文件

请在打开 ComfyUI 前完成资产准备。一套干净的输入集所能避免的失败,远多于后期增加采样步数所能弥补的缺陷。

  • 驱动视频:仅含一个可见主体,构图稳定,四肢清晰可见,面部动作明确有力;导出前请裁去冗余静止时段。
  • 参考图像:清晰的全身或三分之二身角色图,需可见双手、双足,且面部无遮挡。
  • 人脸裁剪图:对参考图与驱动视频中的人脸分别进行紧密裁剪,以强化身份与表情对齐效果。
  • Mix 模式用 SAM2 遮罩:完整、无孔洞的人物遮罩,尤其需覆盖发丝、手部及飘动衣物等易遗漏区域。
  • Mix 模式用背景帧:源自原始镜头的干净背景图(clean plates);当被替换演员露出此前被遮挡区域时,应使用这些背景帧。
  • Wan 2.2 Animate 权重:bf16 提供最纯净的全精度路径;int8-convrot 可降低显存压力,但可能伴随一定质量折损。

硬件性能、量化策略与解码耗时仍深刻影响本地体验。我们在 LTX 2.5 与 MiniMax H3 对比分析 中列出的权衡要点,可作为判断“本地运行”还是“采用托管工作流”的实用清单。

Wan Animate 2 模型结构示意图,展示图像与视频的直接条件注入

官方架构图展示了参考图像、参考视频及目标视频 token 如何进入动画流水线。

分步式 ComfyUI 工作流1. 加载 Wan 2.2 Animate 权重。 当显存(VRAM)允许时,为保证质量请选择 bf16;若需更轻量的计算图,则选用 int8-convrot 构建版本。请确认所用 VAE 和文本编码器(text encoder)与工作流匹配。

  1. 连接 WanVideoAnimateEmbeds 将参考身份图像(reference identity)、驱动姿态序列(driver pose sequence)、人脸裁剪图(face crops)及 SAM2 掩码(SAM2 mask)输入其中。Mix 模式需要最干净的掩码,因为原始背景必须在替换过程中完整保留。
  2. 匹配驱动视频尺寸。widthheightnum_frames 设置为已准备好的驱动视频参数。建议使用能被 16 整除的分辨率,并先以短片段进行测试。
  3. 配置 WanVideoSampler 添加直接场景提示词(direct scene prompt)、任意兼容的 LoRA、采样器(sampler)、调度器(scheduler)、随机种子(seed)及步数(step count)。提示词应侧重描述外观与环境,而非与驱动动作相冲突。
  4. 选择 Mix 或 Move 模式。 在 Mix 模式下,将原始场景与背景帧接入流程;在 Move 模式下,则让模型围绕动画化参考图像重建整个环境。
  5. 解码并保存结果。 首先以全尺寸检查首个输出结果,再对比面部、手指、掩码边缘、脚部与地面接触点、唇部运动节奏等细节与驱动视频的一致性,确认无误后再提升时长或分辨率。

如希望在不安装模型的前提下验证角色与构图效果,可先从 参考图转视频生成器 入手,再将已通过审核的输入图像对导入 ComfyUI。

提升效果 — 常见问题修复与实用技巧

  • 背景漂移(Background drift): Mix 模式下需提供干净的背景帧,并使用坚实(solid)的 SAM2 掩码。过度羽化(feathering)可能在主体周围产生光晕(halo)效应。
  • 面部漂移(Face drift): 使用锐利的人脸裁剪图、均匀光照,以及与驱动视频角度接近的参考图像。首次测试时避免手部遮挡面部。
  • 分辨率不匹配(Resolution mismatch): widthheightnum_frames 必须与驱动视频完全一致。应在进入计算图前一次性完成缩放,而非在多个节点中重复调整。
  • 唇部动作不自然(Unnatural lips): 优选口型清晰可见、发音清晰、运动模糊较弱的驱动视频。极端侧脸角度会显著降低可用唇部细节。
  • 迭代速度慢(Slow iteration): 可应用兼容的 lightx2v 步骤蒸馏(step-distillation)LoRA,并从短片段起步。测试阶段减少步数十分有益,但最终运行结果务必与未蒸馏基线(undistilled baseline)对照评估。

每次仅调整一个变量。固定随机种子(seed)、使用短驱动片段、保存输入数据集,可使每一次重试都成为一次有效对比,而非全新实验。

应用场景 — 使用 Wan Animate 2 可构建的内容类型

  1. AI 主持人或数字人 — Move 模式: 当布景可围绕主持人动态重建时,将录制好的真人表演转化为干净的主持人肖像动画。
  2. 电商模特替换 — Mix 模式: 保留商品布景与摄像机运镜,仅将真人模特替换为品牌活动指定的角色。
  3. 自有 IP 动画化 — Move 模式: 将人类手势与面部微表情节奏迁移至吉祥物、插画角色或风格化 3D 角色。
  4. UGC 舞蹈与动作类内容 — Move 模式: 将一张已获批准的图像一键生成以动作为主导的社交短视频,无需手动关键帧动画。
  5. 批量广告角色替换 — Mix 模式: 在保持相同剪辑结构、拍摄地点、道具与音频的前提下,为多个变体快速适配不同出镜角色。

对于高频复用的品牌角色,数据集一致性比随意添加新素材更为重要。我们在 MiniMax H3 LoRA 训练指南 中介绍的数据准备与验证实践,同样高度适用于定制化动画项目。

结语

最简明的规则是:Move = 对图像进行动画化;Mix = 在视频中替换人物。
请始终从干净的参考图像与短驱动片段起步,锁定分辨率与掩码参数,待身份特征与动作表现稳定后,再逐步扩大规模。若您希望沿用相同的参考图像驱动工作流,却无需本地维护权重与节点,立即前往 Seedance 创建您的下一个 AI 视频 →

准备好亲自试试了吗?

在 Seedance 中实践本指南的步骤,几分钟内将提示词或图片变成精致视频。

注册即送免费积分,套餐每月 $20 起。