- 博客
- MiniMax H3 ComfyUI:T2V、I2V 与 R2V 工作流完整配置指南
AI 概览
可以在 ComfyUI 中本地运行 MiniMax H3 吗?
可以。MiniMax H3 具有开源权重,并原生支持 ComfyUI 0.30.0 或更高版本。加载一个 H3 模板,下载所需的扩散模型、文本编码器以及两个 VAE 模型,即可在您自己的硬件上运行。
MiniMax H3 在 ComfyUI 中支持哪些工作流?
ComfyUI 内置了针对文本生成视频(T2V)、带可选首帧/尾帧的图像生成视频(I2V)以及参考图生成视频(R2V)的 H3 模板。这三种工作流均可同步生成原生立体声对话、音效与配乐,并与视频一同输出。
在 ComfyUI 中运行 MiniMax H3 需要多少 VRAM?
不存在单一硬性最低要求。对于剪枝后的 int8 工作流,24GB 显存 GPU 是较实用的目标;社区中已验证可在 12GB GPU + 32GB 系统内存、启用卸载(offloading)及高速存储条件下完成 480p 分辨率的简化测试。
准备好亲自试试了吗?
注册即送免费积分,套餐每月 $20 起。
是否存在比在 ComfyUI 中本地运行 MiniMax H3 更简单的替代方案?
有。Seedance 提供基于浏览器的音视频生成服务,无需本地下载模型、配置节点或规划 GPU 显存,当您更关注获得成品视频而非自定义本地节点图时,该方案更为简便。
什么是 MiniMax H3?为何要在 ComfyUI 中运行它?
MiniMax H3 是一款开源权重、全模态(omni-modal)生成模型,可在统一上下文中理解文本、图像、视频与音频。它最高可生成 2K 分辨率、24fps、约 15 秒长度的视频,并同步生成语音、音效与配乐,全部以原生立体声格式输出。
ComfyUI 将这些能力转化为可视化的节点图。您可以自由选择模型精度、随机种子(seed)、分辨率、时长、调度器(scheduler)、参考输入、首帧或尾帧,以及输出路径——随后将整个节点图保存为可复用的生产级工作流。官方模板已覆盖 T2V、I2V 与 R2V 场景,而核心 H3 节点亦可灵活重组,构建更专业定制化的工作流。
当参数精细控制、节点复用性、输入私密性或批量自动化比部署耗时更重要时,请选择本地运行 H3。它适合已熟悉 ComfyUI 的创作者,也适用于希望规避按次调用 API 配额限制的团队。其权衡在于:需占用大量存储空间、需细致规划 GPU 显存、模型下载耗时较长,且排错难度高于纯浏览器工作流。
系统要求与模型下载
请先将 ComfyUI 升级至 0.30.0 或更高版本,然后打开 Workflow → Browse Workflow Templates → Video,并选择任一 MiniMax H3 模板。ComfyUI 可自动提示缺失文件,但手动放置文件更便于问题诊断。
| 必需文件 | 放入路径 | 用途 |
|---|---|---|
minimax_h3_fl2va_pruned_int8_convrot.safetensors |
ComfyUI/models/diffusion_models/ |
用于 T2V、I2V 及首/尾帧生成 |
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors |
ComfyUI/models/text_encoders/ |
多模态提示词与参考内容理解 |
minimax_h3_video_vae_fp16.safetensors |
ComfyUI/models/vae/ |
视频潜在空间(latent)编码与解码 |
minimax_h3_audio_vae_fp32.safetensors |
ComfyUI/models/vae/ |
原生音频编码与解码 |
R2V 工作流需使用 diffusion_models/ 目录下的 minimax_h3_ref2va_pruned_int8_convrot.safetensors,而非 FL2VA 扩散模型文件。请保留完整文件名;添加后请刷新模型列表或重启 ComfyUI。
请将 24GB VRAM 视为剪枝 int8 路径下较舒适的规划目标,而非官方公布的最低要求。显存较低的显卡需采用更小帧尺寸、更短视频时长、更激进的卸载策略,并确保系统内存充足、NVMe 存储空间足够以支持模型交换。若节点图无法加载,或大部分时间耗费于显存交换(swapping),请优先降低分辨率,或考虑将工作流转至云端硬件执行。
MiniMax H3 文本生成视频(T2V)工作流配置
- 打开模板库,加载 MiniMax H3 T2V 模板。
- 确认已正确选择扩散模型、Qwen3-VL 文本编码器、视频 VAE 与音频 VAE。
- 在 Resolution Selector(分辨率选择器) 中选择宽高比与百万像素数(megapixels);保持
multiple参数为32。 - 输入一条结构化提示词(prompt),设置视频时长与随机种子(seed),然后提交该节点图(queue the graph)。
- 在提升分辨率前,先预览画面、对话、音效、配乐及最终帧效果。
H3 的原生工作画布采用 768px 短边,并将单边长度上限设为约 1344px。在 16:9 比例下,约 1.0 百万像素 对应分辨率约为 1344×768。建议先以更低分辨率进行提示词测试,仅对已验证有效的配置再逐步提升分辨率。视频时长会按 H3 的帧块(frame-block)网格(24fps)自动对齐,因此 ComfyUI 可能对您输入的时长值做轻微调整。
请先撰写场景描述,再依次加入定时动作、镜头运动与音频说明,全部写入同一段提示词中。一份简洁清晰的 T2V 提示词,远比堆砌大量互不相关的电影术语更可靠。如需更快捷的托管起点,Seedance 文本生成视频工作流 可跳过本地节点图配置与模型下载步骤。
MiniMax H3 T2V 的官方 ComfyUI 模板输出。此为真实工作流样例,由 Seedance R2 托管以保障稳定播放。
MiniMax H3 图像生成视频(I2V)工作流配置
I2V 模板使用节点 MiniMaxH3ImageToVideo。将一张图像连接至 first_frame 输入端口,可选地将另一张图像连接至 last_frame 端口,并在提示词中描述二者之间的运动过程。这两个输入在节点层面均为可选,因此同一套 FL2VA 权重可同时支持纯文本驱动、仅首帧、仅尾帧,或首尾帧并用等多种工作流。
I2V 最适用于产品展示、角色连贯性呈现、受控转场及风格化动画。请将输出尺寸匹配 H3 的 768px 短边画布,保持长宽均能被 32 整除,并避免输入过小或严重压缩的源图像。请先明确描述需保持不变的内容,再说明镜头运动。

随 ComfyUI 的 MiniMax H3 I2V 模板一同分发的真实输入图像。
该源图像生成的官方 I2V 结果。请对比产品外形、材质、滚轮位置、摄像机运动路径及声音——而不仅限于首帧视觉冲击力。
如需实现相同的“输入→动态”理念,但又不想维护本地权重,请尝试 Seedance 图像转视频(Image to Video)。
MiniMax H3 参考视频(R2V)工作流配置
R2V 使用 MiniMaxH3ReferenceToVideo 节点及独立的 ref2va 扩散权重。它支持混合输入:图像、视频与音频,因此目标镜头可分别从不同来源借用角色身份、视觉风格、主体运动、摄像机运动或人声。
请按明确顺序连接参考素材,并在提示词中严格使用如下命名:<Picture 1>、<Video 1> 和 <Audio 1>。为每个参考指定唯一任务。例如:从 <Picture 1> 保留角色形象,从 <Video 1> 复用推轨运镜,从 <Audio 1> 匹配人声音色。当前 ComfyUI 工作流最多支持九张图像、三段视频及三段独立音频片段。
使用 ref_image_size=match 可加速测试;若身份保真度优先于速度,则使用 max,以在不超过 2048px 前提下保留参考图像的较短边。过多重叠参考会削弱指令遵循能力,因此请先验证双参考图效果,再逐步增加。
使用分发版角色与风格参考生成的官方 R2V 模板输出。
如需托管式参考工作流,请打开 Seedance 参考视频(Reference to Video)。MiniMax H3 参考视频指南 提供更深入的提示词撰写与参考分配实操说明。
提升 MiniMax H3 输出质量的提示词撰写技巧
H3 提示词需明确使用三个字段:integrated_multimodal_description(整合式多模态描述)、overall_soundscape(整体声景)和 non_diegetic_music(非叙事性音乐)。在场景描述中,请写明分段时间码镜头、可见动作、摄像机调度及精确对白;为反复出现的说话人分配稳定 ID(如 (S1)),且仅将实际说出的词语置于 <d>[English] ...</d> 标签内。
T2VA — 较弱: 一个具有酷炫音效的电影级城市场景。
T2VA — 更优: 0–3 秒:宽幅雨中斑马线镜头,缓慢向前推轨;3–7 秒:快递员转向镜头。立体声脚步声与车流声;低频打击乐于第 4 秒起奏。
I2VA/FL2VA — 较弱: 对此图像进行戏剧化动画处理。
I2VA/FL2VA — 更优: 保持产品几何结构、滚轮、按键、透明外壳及蓝橙配色照明。执行一次缓慢的 30 度环绕运镜;不添加新文字或部件。最终帧须与所提供末帧对齐。
R2V — 较弱: 综合运用全部参考素材,制作一段动作视频。
R2V — 更优: 从 <Picture 1> 保留角色身份与服装;仅从 <Video 1> 复制摄像机运动;从 <Audio 1> 匹配人声音色。不得迁移视频中的主体或背景。
T2VA 需完整构建世界设定;I2VA 应先保护源图像,再叠加运动;FL2VA 与 L2VA 必须描述向所提供边界帧的过渡过程;R2V 则必须阐明每个参考与目标之间的关系。MiniMax H3 提示词指南 进一步展开各模式专属的提示范式。
MiniMax H3:ComfyUI 本地部署 vs. 浏览器端 AI 视频工具对比
| 维度 | ComfyUI 本地运行 H3 | Seedance | Comfy Cloud |
|---|---|---|---|
| 配置方式 | 安装/更新 ComfyUI,并放置大型权重文件 | 直接在浏览器中打开 | 加载托管式 ComfyUI 模板 |
| 本地显存(VRAM) | 必需;具体需求取决于精度与输出设置 | 无需 | 本地无需 |
| 工作流控制 | 全节点级控制与自动化能力 | 简化生成界面 | 无本地硬件的 ComfyUI 图形界面 |
| 原生音频支持 | H3 原生立体声音频,与视频同步生成 | 音视频联合工作流 | 云端计算下的相同 H3 工作流 |
| 最适用场景 | 深度定制、本地输入、可复用图形 | 无需配置的快速构思与生产 | 拥有 ComfyUI 使用经验但缺乏本地 GPU 的用户 |
当工作流图本身即为您的生产系统组成部分时,请选择本地 ComfyUI;当您希望使用其节点功能却不愿承担硬件负担时,请选择云托管 ComfyUI;当您希望从提示词或参考素材直接产出可用成片,且希望减少基础设施决策时,请选择 Seedance。立即在浏览器中试用 Seedance →
总结
MiniMax H3 是 ComfyUI 中最具能力的开源权重模型之一,可同步生成视频与原生音频。启动流程仅需三步:升级至 ComfyUI 0.30.0+,将扩散模型、文本编码器及两个 VAE 放入对应文件夹,随后加载匹配的 T2V、I2V 或 R2V 模板。初期测试宜从小规模开始,为每个参考明确分配任务,并在提示词验证有效后再提升分辨率;若本地下载、显存占用与节点维护成本已超出深度控制带来的收益,则基于浏览器的 Seedance 工作流将是更快抵达生产的路径。

MiniMax H3 乱码语音修复:原因与解决方案
通过更清晰的对话标签、更短的提示词、稳定的说话人 ID、单语脚本以及实用的备用工作流,修复 MiniMax H3 的乱码音频问题。
阅读文章
MiniMax H3 Turbo LoRA:5 倍加速视频生成配置指南
在 ComfyUI 中安装 MiniMax H3 Turbo LoRA,选择 v4 或 v1 版本,连接采样器节点,并将生成步数调至 4–8 步,以实现更快的视频生成并保留立体声音频。
阅读文章
MiniMax H3 循环:如何创建无缝 AI 视频循环(2026 指南)
了解 MiniMax H3 循环视频的工作原理,按步骤操作工作流,复制五个循环提示词,对比定价,并选择最适合的 AI 循环生成器。
阅读文章