Wan Animate 2 教程:Move 模式、Mix 模式与 ComfyUI 工作流指南

E
Emma Chen·阅读约 2 分钟·Aug 19, 2026
分享到 X
Wan Animate 2 教程:Move 模式、Mix 模式与 ComfyUI 工作流指南

AI 概览

什么是 Wan Animate 2?它能做什么?

Wan-Animate-2 是一个开源的角色动画模型,可将驱动视频的全身动作及面部表演迁移到一张参考人物图像上。它还支持通过提示词控制背景与视角变化。

Wan Animate 2 中 Move 模式与 Mix 模式有何区别?

Move 模式使用驱动视频的动作对参考图像进行动画生成,并生成全新背景;Mix 模式则在原始场景中替换表演者,但该模式属于早期 Wan2.2 Animate 工作流。

我能否在本地 ComfyUI 中运行 Wan Animate 2?

可以。当前 ComfyUI 模板通过 WanAnimate2ToVideo 节点支持 Wan-Animate-2,所需输入包括参考图像、原始驱动视频、模型文件及文本提示。请先更新 ComfyUI,因为稳定版桌面发行版可能滞后于 nightly 版本的支持能力。

Wan Animate 2 需要哪些输入?

当前 Move 工作流需要一张清晰的参考图像、一段驱动视频,以及外观/背景提示词。而面部裁剪图、稳固的人物掩码(mask)和干净的背景帧,则适用于旧版 Mix 替换工作流。

Wan Animate 2 实际所做之事——及其独特之处

Wan-Animate-2 并非标准的图像到视频(I2V)模型。普通 I2V 模型以静态图像为起点,仅依靠文本提示“发明”运动;而 Wan-Animate-2 则引入第二输入——驱动视频,并将其时间节奏、姿态、手势及面部表演完整迁移到您图像中的人物身上。

新模型直接读取原始驱动帧,不再依赖中间骨骼提取器。当表演包含细微的手部节奏、肩部运动、面部变化,或摄像机视角等易被姿态图(pose map)简化的要素时,这一点尤为关键。文本提示则可独立描述输出背景与视角。

Wan-Animate-2 架构图:参考图像与驱动视频共同进入共享的角色动画流水线

官方 Wan-Animate-2 架构:参考图像定义身份,驱动视频定义表演,文本控制外观与场景方向。

若您仅需一张静态图像来定义生成镜头的起始或结束帧,请参阅 首尾帧指南。若任务目标是精确复刻某段特定表演,则应选用 Wan-Animate-2。

Move 模式 vs Mix 模式——如何选择合适模式

名称容易混淆,是因为该项目目前同时流通着两代版本:Wan-Animate-2 采用 Move 风格的角色动画工作流;Mix 则是早期 Wan2.2 Animate 模板中的角色替换模式。

Move 模式 Mix 模式
模型版本 当前 Wan-Animate-2 早期 Wan2.2 Animate
输入 参考图像 + 驱动视频 参考图像 + 驱动视频 + 掩码/背景控制
背景 由提示词生成 保留原始视频场景
最适用场景 动画化插画、虚拟形象或自定义角色 替换现有视频片段中的人物
一句话规则 “让这张图像执行该动作” “替换这段视频中的人物”

选择 Move:适用于吉祥物在干净布景中跳舞、插画主持人进行讲解,或角色演绎已录制好的动作序列等场景。
选择 Mix:当原始片段中的湿滑街道、灯光、摄像机运动、道具及其他人物必须全部保留,仅需更换表演者时。

开始前准备——输入与模型文件

请根据所选模式,准备最小必要输入集:

  • 驱动视频(Driver video):动作来源。建议采用动作清晰、肢体可见、遮挡最少、且构图尽量贴近参考图像的视频。
  • 参考图像(Reference image):一张锐利、正面或三分之四角度的人物图像。若驱动视频为全身镜头,则参考图像也宜采用全身构图。
  • 提示词(Prompts):一条外观/背景描述 + 一条简洁的动作描述。请勿将动作语言混入外观提示中。
  • 仅 Mix 模式所需控制项:用于提升表情精度的面部裁剪图、稳固的人物掩码(mask),以及用于保持场景一致性的干净背景帧。

官方 ComfyUI 包提供扩散模型文件 wan_animate_2_int8_convrot.safetensors,以及 UMT5 文本编码器、CLIP 视觉编码器、Wan VAE,还有一个可选的 LightX2V 步骤蒸馏 LoRA。完整官方检查点(checkpoint)为 BF16 格式;仅当您的硬件能承受其显著更高的显存需求时才建议使用。INT8 ConvRot 包则是 ComfyUI 环境下兼顾低显存占用的实用选择。

官方参考图像:一只银色虎斑猫角色身着深蓝色制服

可用的参考图像应确保角色无遮挡,且构图与驱动视频匹配。本官方示例即为全身角色搭配全身动作。

本地视频流水线对硬件要求依然较高。若您正将搭建难度与其他本地模型对比,LTX 2.5 评测 同样阐释了这一实际权衡:开源权重免费,但 GPU 时间与排障成本并非无偿。

分步 ComfyUI 工作流1. 更新 ComfyUI。 打开 Workflow → 浏览模板 → 视频,加载 Wan Animate 2 模板。若缺失 WanAnimate2ToVideo 或 WanAnimate2Cache 节点,通常说明你的构建版本落后于该模板。

  1. 放置模型文件。 将扩散模型、LoRA、文本编码器、CLIP 视觉模型和 VAE 放入模板中所示的对应文件夹内。添加完成后重启 ComfyUI。

  2. 加载输入。 添加参考图像(reference image)与驱动视频(driver video)。首先匹配裁剪方式:特写对特写,或全身对全身。

  3. 检查核心节点。 当前工作流使用 WanAnimate2ToVideo 和原始驱动帧。WanVideoAnimateEmbeds、姿态预处理器(pose preprocessors)、SAM 2 掩码(SAM 2 masks)、background_video 及 character_mask 属于旧版 Wan2.2 Animate Mix 路径。

  4. 设置尺寸与长度。 宽度和高度需保持能被 16 整除。该模板生成 81 帧窗口,以 24 fps 播放约为 3.4 秒;如需处理更长的驱动视频,请复制并串联 Motion Transfer 子图。

  5. 编写提示词并采样。 在主提示词(main prompt)中描述角色与背景,在运动提示词(motion prompt)中仅描述动作表现。从模板的采样器设置起步;当速度与低步数迭代比最高保真度更重要时,可改用蒸馏版 LoRA(distilled LoRA)。

  6. 排队并复核。 保存输出视频后,检查身份一致性、手部、面部、足部接触、背景稳定性,以及任意串联窗口之间的接缝(seam)。

官方 ComfyUI Wan-Animate-2 输出 · 街舞动作迁移

官方模板预览将动画化参考图像并排置于驱动影像旁,便于全程比对节奏、肢体运动、构图及身份保留效果。

提升效果 — 常见问题修复与技巧

  • 身份或面部漂移(identity or face drift): 使用与驱动影像构图一致、更清晰锐利的参考图像。避免过小的人脸、仅侧脸的参考图,以及手部遮挡面部的情形。
  • 背景漂移(background drift): 保持背景提示词字面化且稳定。若需精确复现现有场景,请切换至旧版 Mix 工作流,并提供干净背景与坚实掩码(solid mask)。
  • 速度错误或动作卡顿(wrong speed or jerky motion): 加载前先将驱动视频重采样至约 16–24 fps。当前工作流直接读取帧,而非自动适配各类源视频帧率。
  • 肢体模糊或断裂(soft or broken limbs): 简化驱动视频内容、减少遮挡,并尝试更短的帧窗口。快速转身、地面动作(floor work)及两人交叉行进等场景,远比无遮挡的单人表演更难处理。
  • 长片段中可见接缝(visible seam in a long clip): 通过 continue_motion 重叠串联窗口,推进 video_frame_offset,并在连接处出现卡顿(hiccups)时裁去重复的第一帧。
  • 显存不足错误(out-of-memory error): 降低生成尺寸、使用 INT8 ConvRot 检查点、将缓存移至 CPU,或在 BF16 基础模型前先测试蒸馏版配置。

若某 LoRA 提升了速度却改变了身份或动作风格,请在采纳前,用同一组固定驱动/参考图像对进行对比验证。尽管其模型家族不同,LoRA 训练指南 提供了一种实用的评估模式。

应用场景 — Wan Animate 2 可构建的内容

  1. AI 虚拟主持人 — Move 模式。 录制清晰的人类演讲视频,再将其动作迁移到插画风格主持人或吉祥物上。如需托管式替代方案,可从 Reference to Video 入手。

  2. 电商模特变体 — Mix 模式。 在早期 Mix 工作流中,保留店铺、商品、镜头运动与光照,仅替换出镜表演者。

  3. 自有 IP 角色动画 — Move 模式。 为游戏、漫画或品牌角色生成舞蹈、问候或动作表现,无需逐关节关键帧动画。

  4. 用户生成内容(UGC)动作重制 — Move 模式。 将一段已批准的动作表现迁移至新角色图像;若仅需较简单动画、不强求精准动作迁移,可使用 Image to Video。

  5. 广告本地化变体 — Mix 模式。 复用同一镜头设计,仅替换发言人,后续在后期制作中完成 Logo、字幕与法律声明等内容。

请仅使用您拥有版权或已获授权处理的参考图像与驱动影像。成功渲染结果应视为初稿,须经人工审核身份、主张(claims)、连贯性及场景细节后方可定稿。

结论

决策规则很简单:Move 模式让一张图像“动起来”;Mix 模式则在一段视频中“替换人物”。 对当前 Wan-Animate-2 ComfyUI 工作流,请在参考图像与驱动视频高度匹配的前提下使用 Move 模式;仅当必须严格保留源视频场景时,才选用早期 Wan2.2 Animate Mix 路径。

若您不想自行安装模型、管理显存(VRAM),或手动串联 ComfyUI 窗口,欢迎前往 Seedance 尝试角色动画 →。

准备好亲自试试了吗?

在 Seedance 中实践本指南的步骤,几分钟内将提示词或图片变成精致视频。

注册即送免费积分,套餐每月 $28 起。