- 博客
- Wan Animate 2 教程:Move 模式、Mix 模式与 ComfyUI 工作流指南
AI 概览
什么是 Wan Animate 2?它能做什么?
Wan Animate 2 是一个基于 Wan 2.2 构建的开源角色动画系统。它通过 Move 模式或 Mix 模式,将驱动视频中的全身动作、面部表情及口型运动迁移至参考角色。
Wan Animate 2 中 Move 模式与 Mix 模式有何区别?
Move 模式对静态角色进行动画化,并由模型生成周围背景。Mix 模式则在保留原始场景、背景和音频的前提下,替换驱动视频中的人物。
我能否在本地 ComfyUI 中运行 Wan Animate 2?
可以。该工作流使用 Wan 2.2 Animate 权重、WanVideoAnimateEmbeds、采样器及 VAE。若显存允许,请选择 bf16 精度;如需更轻量的本地配置,可选用 int8-convrot 量化方案。
准备好亲自试试了吗?
注册即送免费积分,套餐每月 $20 起。
Wan Animate 2 需要哪些输入?
两种模式均需参考图像与驱动视频。稳定可靠的人脸裁剪可提升身份一致性;Mix 模式还额外受益于干净的背景帧以及高质量的 SAM2 人物遮罩。
Wan Animate 2 实际所做之事——及其独特之处
普通图像转视频模型仅依据一张静态图与文本提示“发明”运动。而 Wan Animate 2 则将真实表演视为结构化引导:驱动视频提供姿态、节奏、面部表情与口型运动,参考图像则提供角色身份。因此,当表演本身的重要性不亚于视觉外观时,该系统尤为适用。
这也不同于端点控制式生成(endpoint-controlled generation)。首帧+末帧工作流仅定义镜头起止位置,但无法复现其间所有关键动作节拍。当目标帧比表演迁移更重要时,请参阅 MiniMax H3 首帧与末帧指南。
该三联画面同时显示静态参考图、驱动表演及生成结果,是一种比单张精修帧更有价值的质量检查方式,因为你可直接比对肢体动作节奏与角色身份一致性。
Move 模式 vs Mix 模式——如何选择合适模式
两种模式均实现表演迁移,但解决的是不同制作问题。请在构建遮罩或准备额外帧前,先参考下表决策:
| 决策维度 | Move 模式 | Mix 模式 |
|---|---|---|
| 输入要求 | 参考图像 + 驱动视频 | 参考图像 + 驱动视频 |
| 背景处理 | 由模型重新生成 | 保留原始视频背景 |
| 最佳适用场景 | 角色动作与图像动画 | 在既有场景中替换人物 |
| 一句话准则 | “让画面动起来” | “替换视频中的人物” |
当角色与动作是创意核心、且环境允许变化时,请选择 Move 模式;当布景、道具、灯光、摄像机运动及声音已在源片段中完成良好设计时,请选择 Mix 模式。若希望先在浏览器中快速验证相同理念,可在投入本地图构建前,尝试 运动控制工作流。
本例说明了剪影与身体比例为何至关重要:即使驱动者与角色外观迥异,只要参考图具备清晰的全身姿态、且驱动者始终处于画面内,最终结果仍具高度可读性。
开始前必备事项——输入素材与模型文件
请在打开 ComfyUI 前完成资产准备。一套干净的输入集所能避免的失败,远多于后期增加采样步数所能弥补的缺陷。
- 驱动视频:仅含一个可见主体,构图稳定,四肢清晰可见,面部动作明确有力;导出前请裁去冗余静止时段。
- 参考图像:清晰的全身或三分之二身角色图,需可见双手、双足,且面部无遮挡。
- 人脸裁剪图:对参考图与驱动视频中的人脸分别进行紧密裁剪,以强化身份与表情对齐效果。
- Mix 模式用 SAM2 遮罩:完整、无孔洞的人物遮罩,尤其需覆盖发丝、手部及飘动衣物等易遗漏区域。
- Mix 模式用背景帧:源自原始镜头的干净背景图(clean plates);当被替换演员露出此前被遮挡区域时,应使用这些背景帧。
- Wan 2.2 Animate 权重:bf16 提供最纯净的全精度路径;int8-convrot 可降低显存压力,但可能伴随一定质量折损。
硬件性能、量化策略与解码耗时仍深刻影响本地体验。我们在 LTX 2.5 与 MiniMax H3 对比分析 中列出的权衡要点,可作为判断“本地运行”还是“采用托管工作流”的实用清单。

官方架构图展示了参考图像、参考视频及目标视频 token 如何进入动画流水线。
分步式 ComfyUI 工作流1. 加载 Wan 2.2 Animate 权重。 当显存(VRAM)允许时,为保证质量请选择 bf16;若需更轻量的计算图,则选用 int8-convrot 构建版本。请确认所用 VAE 和文本编码器(text encoder)与工作流匹配。
- 连接
WanVideoAnimateEmbeds。 将参考身份图像(reference identity)、驱动姿态序列(driver pose sequence)、人脸裁剪图(face crops)及 SAM2 掩码(SAM2 mask)输入其中。Mix 模式需要最干净的掩码,因为原始背景必须在替换过程中完整保留。 - 匹配驱动视频尺寸。 将
width、height和num_frames设置为已准备好的驱动视频参数。建议使用能被 16 整除的分辨率,并先以短片段进行测试。 - 配置
WanVideoSampler。 添加直接场景提示词(direct scene prompt)、任意兼容的 LoRA、采样器(sampler)、调度器(scheduler)、随机种子(seed)及步数(step count)。提示词应侧重描述外观与环境,而非与驱动动作相冲突。 - 选择 Mix 或 Move 模式。 在 Mix 模式下,将原始场景与背景帧接入流程;在 Move 模式下,则让模型围绕动画化参考图像重建整个环境。
- 解码并保存结果。 首先以全尺寸检查首个输出结果,再对比面部、手指、掩码边缘、脚部与地面接触点、唇部运动节奏等细节与驱动视频的一致性,确认无误后再提升时长或分辨率。
如希望在不安装模型的前提下验证角色与构图效果,可先从 参考图转视频生成器 入手,再将已通过审核的输入图像对导入 ComfyUI。
提升效果 — 常见问题修复与实用技巧
- 背景漂移(Background drift): Mix 模式下需提供干净的背景帧,并使用坚实(solid)的 SAM2 掩码。过度羽化(feathering)可能在主体周围产生光晕(halo)效应。
- 面部漂移(Face drift): 使用锐利的人脸裁剪图、均匀光照,以及与驱动视频角度接近的参考图像。首次测试时避免手部遮挡面部。
- 分辨率不匹配(Resolution mismatch):
width、height与num_frames必须与驱动视频完全一致。应在进入计算图前一次性完成缩放,而非在多个节点中重复调整。 - 唇部动作不自然(Unnatural lips): 优选口型清晰可见、发音清晰、运动模糊较弱的驱动视频。极端侧脸角度会显著降低可用唇部细节。
- 迭代速度慢(Slow iteration): 可应用兼容的
lightx2v步骤蒸馏(step-distillation)LoRA,并从短片段起步。测试阶段减少步数十分有益,但最终运行结果务必与未蒸馏基线(undistilled baseline)对照评估。
每次仅调整一个变量。固定随机种子(seed)、使用短驱动片段、保存输入数据集,可使每一次重试都成为一次有效对比,而非全新实验。
应用场景 — 使用 Wan Animate 2 可构建的内容类型
- AI 主持人或数字人 — Move 模式: 当布景可围绕主持人动态重建时,将录制好的真人表演转化为干净的主持人肖像动画。
- 电商模特替换 — Mix 模式: 保留商品布景与摄像机运镜,仅将真人模特替换为品牌活动指定的角色。
- 自有 IP 动画化 — Move 模式: 将人类手势与面部微表情节奏迁移至吉祥物、插画角色或风格化 3D 角色。
- UGC 舞蹈与动作类内容 — Move 模式: 将一张已获批准的图像一键生成以动作为主导的社交短视频,无需手动关键帧动画。
- 批量广告角色替换 — Mix 模式: 在保持相同剪辑结构、拍摄地点、道具与音频的前提下,为多个变体快速适配不同出镜角色。
对于高频复用的品牌角色,数据集一致性比随意添加新素材更为重要。我们在 MiniMax H3 LoRA 训练指南 中介绍的数据准备与验证实践,同样高度适用于定制化动画项目。
结语
最简明的规则是:Move = 对图像进行动画化;Mix = 在视频中替换人物。
请始终从干净的参考图像与短驱动片段起步,锁定分辨率与掩码参数,待身份特征与动作表现稳定后,再逐步扩大规模。若您希望沿用相同的参考图像驱动工作流,却无需本地维护权重与节点,立即前往 Seedance 创建您的下一个 AI 视频 →

LTX 2.5 评测:速度、多镜头生成,及其与 MiniMax H3 的对比
一篇关于 LTX 2.5 的真实评测,涵盖生成速度、原生多镜头视频能力、ComfyUI 配置、开源权重、图像质量,并与 MiniMax H3 进行直接对比。
阅读文章
MiniMax H3:30 步 vs 50 步——质量与速度究竟有何变化
对比 MiniMax H3 在 20、30 和 50 步下的图像细节、生成耗时、音频质量、Turbo LoRA 速度,以及各工作流的最佳步数设置。
阅读文章
MiniMax H3 LoRA 训练:面向自定义视频风格的完整微调指南
准备 MiniMax H3 视频数据集,选择 T2V、I2V、首尾帧(first-last-frame)或 Ref2VA 训练方式,调节 rank 和学习率,并在云端或本地工作流中使用生成的 LoRA。
阅读文章