- 博客
- 2026 年 MiniMax H3 在画质、速度与音频方面的最佳设置
AI 概览
MiniMax H3 视频画质的最佳设置是什么?
使用 1344×768 分辨率(16:9),res_multistep 采样器,simple 调度器,20 步去噪,引导系数(guidance)设为 1,视频偏移(video shift)设为 12,音频偏移(audio shift)设为 3。这是可靠、开源权重的画质基准。
在 ComfyUI 中,MiniMax H3 应该使用多少步?
为获得高质量渲染,请使用 res_multistep 采样器配合 20 步;仅当迭代速度比极致细节更重要时,才在兼容 Turbo LoRA 的前提下使用 4–8 步。
MiniMax H3 本地运行与通过 API 调用时的输出分辨率分别是多少?
已发布的本地权重目标为 768p,通常为 1344×768(16:9)。托管版 H3 可提供更高分辨率输出,包括其上下文内(in-context)的 Regenerate-2K 流水线。
准备好亲自试试了吗?
注册即送免费积分,套餐每月 $20 起。
如何控制 MiniMax H3 中的音频?
为每种声音、人声或乐器命名,并明确说明其出现时间。保持原生 32 kHz 立体声音轨,将音频偏移(audio shift)设为 3(即已发布基准值);若音画同步发生漂移,则应简化相互冲突的提示线索。
为何 MiniMax H3 设置与其他视频模型不同
MiniMax H3 并不表现得像传统扩散模型(例如 CFG 设为 7.5 左右的模型)。它是经引导蒸馏(guidance-distilled)训练的模型,因此引导系数 1 才是预期值;提高该值可能导致边缘硬化、运动失稳,甚至使结果变差。此外,H3 同时生成视频与立体声音频,且两路流各自采用独立的 sigma 调度表。
帧数遵循 17n+5 的网格规则(24 fps 下)。一段实用的五秒本地视频为 124 帧;更长的视频目标应四舍五入至合法帧数,而非随意输入任意数值。上述三条规则——引导系数 1、视频与音频双偏移、以及帧数网格——构成了以下所有设置的基础。如需先获取完整工作流图,请参阅 MiniMax H3 ComfyUI 配置指南。
分辨率设置 —— 768p、1080p 与 2K 详解
分辨率应匹配当前工作阶段。本地开源权重上限为 768p 类别;1344×768 是标准的 16:9 画布,接近 100 万像素。0.5MP 画布适用于构图与提示词方向检查。托管输出则消除了本地显存压力,并新增了更高分辨率的再生路径。
| 目标 | 典型设置 | 最佳用途 | 权衡点 |
|---|---|---|---|
| 本地预览 | 约 0.5MP | 提示词与运动测试 | 速度最快,细节较柔和 |
| 本地高质量输出 | 1344×768(16:9) | 最终本地渲染 | 已发布本地最高尺寸 |
| 托管 1080p 类别 | 服务预设 | 社交媒体、广告、客户审阅 | 细节更丰富,无需本地 VRAM |
| 托管 2K | Regenerate-2K | 商业交付、小字号文本、裁剪需求 | 成本与处理时间最高 |
决策十分简单:以 0.5MP 迭代,以 768p 验证,仅对选定镜头使用托管 2K。下方官方 H3 生成片段是极佳的质量检验参考:请检查皮肤纹理、手部、背景行人、咖啡馆招牌及音频连续性,而非仅凭单帧静图评判。
步数、采样器与调度器 —— 行之有效的基准配置
对于当前 ComfyUI 工作流,最实用的基准配置是:res_multistep 采样器 + simple 调度器 + 20 步去噪。部分节点将其显示为 21 个 sigma 点,因为 21 个点可生成 20 次 DiT 前向传播。切勿在未确认节点标签含义的前提下,将两个数值均误设为 20。
| 目标 | 采样器 | 调度器 | 步数 | 使用时机 |
|---|---|---|---|---|
| 高质量基准 | res_multistep |
simple |
20 | 最终本地渲染与对比分析 |
| 快速迭代 | Turbo 兼容路径 | simple |
4–8 | 提示词、运动与构图测试 |
| 兼容旧版复现 | Euler | 已发布调度表 | 49–50 次调用 | 精确复现旧有工作流 |
Turbo 并非通用的“减少步数”开关;它需要匹配的适配器与工作流图。建议从 4 步开始进行布局测试,当面部或精细运动需更高稳定性时,提升至 6–8 步,并在最终交付前与一个 20 步基准结果进行比对。MiniMax H3 Turbo LoRA 指南 展示了正确的加载器放置方式,而 LoRA 训练指南 则涵盖自定义风格适配器相关内容。
引导系数(Guidance Scale)、偏移(Shift)与音频参数
请将引导系数保持为 1。H3 已将引导能力内置于已发布的权重中,因此高 CFG 值无法像在旧版图像模型中那样增强提示词遵从性。对于已发布的开源权重调度表,请同时使用视频偏移 12 与音频偏移 3。部分社区工作流图暴露了音频偏移 4;仅当精确复现该特定工作流时才保留该值;若人声、节拍或音效出现漂移,请恢复为 3。
音频提示词在明确指明声源与时刻时效果最佳:陶瓷杯于 00:03 触碰桌面、全程轻柔交通环境音 或 落地时一声干涩的脚步声。避免在同一五秒片段中请求对话、音乐、人群噪声、天气音效及多种效果叠加。如需更优的句子结构与时间表达方式,请参阅 MiniMax H3 提示词指南。
ComfyUI 设置速查表
| 参数 | 优先质量 | 优先速度 |
|---|---|---|
| 百万像素数(Megapixels) | 1.0(1344×768) | 0.5 预览 |
| 步数(Steps) | 20 | 4–8(启用 Turbo LoRA) |
| 采样器(Sampler) | res_multistep |
兼容 Turbo 的采样器 |
| 调度器(Scheduler) | simple |
simple |
| 引导系数(Guidance) | 1 | 1 |
| 视频偏移(Video shift) | 12 | 12 |
| 音频偏移(Audio shift) | 3 | 3 |
| 帧数(Frames) | 合法的 17n+5 数量 |
最短合法测试帧数 |
| 随机种子(Seed) | A/B 测试时固定 | 探索时随机 |
每次仅修改一行。在对比分辨率、步数或偏移量时,请保持随机种子(seed)固定;否则你实际对比的是不同生成结果,而非不同设置。若希望不下载检查点(checkpoint)或不调优图(graph)即可获得结果,请使用 Seedance 并选择优化预设进行生成 →。
各模式对应设置 — T2V、I2V、FLF2V 与 Ref2VA
| 模式 | 模型路径 | 需锁定项 | 设置优先级 |
|---|---|---|---|
| T2V | FL2VA | 提示词(prompt)与随机种子(seed) | 先保证构图,再优化运动与声音 |
| I2V | FL2VA | 首帧图像与宽高比(ratio) | 使潜在画布(latent canvas)匹配输入图像 |
| FLF2V | FL2VA | 首帧与末帧 | 同时匹配两端;提示词仅描述中间过程(journey) |
| Ref2VA | Ref2VA | 参考身份(reference identity)与顺序(ordering) | 仅为该镜头分配其真正需要的参考素材 |
T2V 完全依赖提示词结构,因此请按如下顺序明确主体、动作、摄像机、环境与音频。I2V 从首帧图像继承构图;更改宽高比将导致本可避免的裁剪。FLF2V 锁定首尾两帧,因此应精简提示词,仅保留运动、时机、摄像机路径与声音描述。首帧与末帧指南 包含兼容的图像预处理方法及过渡修复技巧。
Ref2VA 支持更丰富的上下文预算——在受支持的工作流中,最多可接受九张图像、三段视频与三段音频参考——但“最多”并非目标。尽可能仅使用一至两张身份图像、一段运动视频与一段干净的音频参考。额外输入会相互争夺注意力,并加大调试难度。
结论
请牢记 MiniMax H3 基线设置为:768p、20 步、res_multistep、simple、引导系数为 1、偏移量为 12/3;仅在快速迭代阶段使用 0.5MP 与 4–8 步的 Turbo 渲染,待选定满意结果后,再将其迁移至托管式 2K 渲染以获取最终细节。根据所选模式匹配 FL2VA 或 Ref2VA,确保帧数符合 17n+5 网格,用带时间标记的方式描述音频源,并始终一次只调整一个参数。

MiniMax H3 首帧与末帧:如何精准控制 AI 视频两端
了解 MiniMax H3 首帧与末帧(FLF2V)视频工作原理,准备首尾两帧图像,编写以动作为先的提示词,使用 ComfyUI,并解决常见 FLF2V 问题。
阅读文章
MiniMax H3:30 步 vs 50 步——质量与速度究竟有何变化
对比 MiniMax H3 在 20、30 和 50 步下的图像细节、生成耗时、音频质量、Turbo LoRA 速度,以及各工作流的最佳步数设置。
阅读文章
MiniMax H3 LoRA 训练:面向自定义视频风格的完整微调指南
准备 MiniMax H3 视频数据集,选择 T2V、I2V、首尾帧(first-last-frame)或 Ref2VA 训练方式,调节 rank 和学习率,并在云端或本地工作流中使用生成的 LoRA。
阅读文章