2026 年 MiniMax H3 在画质、速度与音频方面的最佳设置

E
Emma Chen·阅读约 2 分钟·Aug 18, 2026
分享到 X
2026 年 MiniMax H3 在画质、速度与音频方面的最佳设置

AI 概览

MiniMax H3 视频画质的最佳设置是什么?

使用 1344×768 分辨率(16:9),res_multistep 采样器,simple 调度器,20 步去噪,引导系数(guidance)设为 1,视频偏移(video shift)设为 12,音频偏移(audio shift)设为 3。这是可靠、开源权重的画质基准。

在 ComfyUI 中,MiniMax H3 应该使用多少步?

为获得高质量渲染,请使用 res_multistep 采样器配合 20 步;仅当迭代速度比极致细节更重要时,才在兼容 Turbo LoRA 的前提下使用 4–8 步。

MiniMax H3 本地运行与通过 API 调用时的输出分辨率分别是多少?

已发布的本地权重目标为 768p,通常为 1344×768(16:9)。托管版 H3 可提供更高分辨率输出,包括其上下文内(in-context)的 Regenerate-2K 流水线。

准备好亲自试试了吗?

注册即送免费积分,套餐每月 $20 起。

免费试用 Seedance

如何控制 MiniMax H3 中的音频?

为每种声音、人声或乐器命名,并明确说明其出现时间。保持原生 32 kHz 立体声音轨,将音频偏移(audio shift)设为 3(即已发布基准值);若音画同步发生漂移,则应简化相互冲突的提示线索。

为何 MiniMax H3 设置与其他视频模型不同

MiniMax H3 并不表现得像传统扩散模型(例如 CFG 设为 7.5 左右的模型)。它是经引导蒸馏(guidance-distilled)训练的模型,因此引导系数 1 才是预期值;提高该值可能导致边缘硬化、运动失稳,甚至使结果变差。此外,H3 同时生成视频与立体声音频,且两路流各自采用独立的 sigma 调度表。

帧数遵循 17n+5 的网格规则(24 fps 下)。一段实用的五秒本地视频为 124 帧;更长的视频目标应四舍五入至合法帧数,而非随意输入任意数值。上述三条规则——引导系数 1、视频与音频双偏移、以及帧数网格——构成了以下所有设置的基础。如需先获取完整工作流图,请参阅 MiniMax H3 ComfyUI 配置指南

分辨率设置 —— 768p、1080p 与 2K 详解

分辨率应匹配当前工作阶段。本地开源权重上限为 768p 类别;1344×768 是标准的 16:9 画布,接近 100 万像素。0.5MP 画布适用于构图与提示词方向检查。托管输出则消除了本地显存压力,并新增了更高分辨率的再生路径。

目标 典型设置 最佳用途 权衡点
本地预览 约 0.5MP 提示词与运动测试 速度最快,细节较柔和
本地高质量输出 1344×768(16:9) 最终本地渲染 已发布本地最高尺寸
托管 1080p 类别 服务预设 社交媒体、广告、客户审阅 细节更丰富,无需本地 VRAM
托管 2K Regenerate-2K 商业交付、小字号文本、裁剪需求 成本与处理时间最高

决策十分简单:以 0.5MP 迭代,以 768p 验证,仅对选定镜头使用托管 2K。下方官方 H3 生成片段是极佳的质量检验参考:请检查皮肤纹理、手部、背景行人、咖啡馆招牌及音频连续性,而非仅凭单帧静图评判。

MiniMax H3 · 官方生成的带原生音频的咖啡馆场景

步数、采样器与调度器 —— 行之有效的基准配置

对于当前 ComfyUI 工作流,最实用的基准配置是:res_multistep 采样器 + simple 调度器 + 20 步去噪。部分节点将其显示为 21 个 sigma 点,因为 21 个点可生成 20 次 DiT 前向传播。切勿在未确认节点标签含义的前提下,将两个数值均误设为 20。

目标 采样器 调度器 步数 使用时机
高质量基准 res_multistep simple 20 最终本地渲染与对比分析
快速迭代 Turbo 兼容路径 simple 4–8 提示词、运动与构图测试
兼容旧版复现 Euler 已发布调度表 49–50 次调用 精确复现旧有工作流

Turbo 并非通用的“减少步数”开关;它需要匹配的适配器与工作流图。建议从 4 步开始进行布局测试,当面部或精细运动需更高稳定性时,提升至 6–8 步,并在最终交付前与一个 20 步基准结果进行比对。MiniMax H3 Turbo LoRA 指南 展示了正确的加载器放置方式,而 LoRA 训练指南 则涵盖自定义风格适配器相关内容。

引导系数(Guidance Scale)、偏移(Shift)与音频参数

请将引导系数保持为 1。H3 已将引导能力内置于已发布的权重中,因此高 CFG 值无法像在旧版图像模型中那样增强提示词遵从性。对于已发布的开源权重调度表,请同时使用视频偏移 12 与音频偏移 3。部分社区工作流图暴露了音频偏移 4;仅当精确复现该特定工作流时才保留该值;若人声、节拍或音效出现漂移,请恢复为 3

音频提示词在明确指明声源与时刻时效果最佳:陶瓷杯于 00:03 触碰桌面全程轻柔交通环境音落地时一声干涩的脚步声。避免在同一五秒片段中请求对话、音乐、人群噪声、天气音效及多种效果叠加。如需更优的句子结构与时间表达方式,请参阅 MiniMax H3 提示词指南

MiniMax H3 · 官方生成的电影开场示例

ComfyUI 设置速查表

参数 优先质量 优先速度
百万像素数(Megapixels) 1.0(1344×768) 0.5 预览
步数(Steps) 20 4–8(启用 Turbo LoRA)
采样器(Sampler) res_multistep 兼容 Turbo 的采样器
调度器(Scheduler) simple simple
引导系数(Guidance) 1 1
视频偏移(Video shift) 12 12
音频偏移(Audio shift) 3 3
帧数(Frames) 合法的 17n+5 数量 最短合法测试帧数
随机种子(Seed) A/B 测试时固定 探索时随机

每次仅修改一行。在对比分辨率、步数或偏移量时,请保持随机种子(seed)固定;否则你实际对比的是不同生成结果,而非不同设置。若希望不下载检查点(checkpoint)或不调优图(graph)即可获得结果,请使用 Seedance 并选择优化预设进行生成 →

各模式对应设置 — T2V、I2V、FLF2V 与 Ref2VA

模式 模型路径 需锁定项 设置优先级
T2V FL2VA 提示词(prompt)与随机种子(seed) 先保证构图,再优化运动与声音
I2V FL2VA 首帧图像与宽高比(ratio) 使潜在画布(latent canvas)匹配输入图像
FLF2V FL2VA 首帧与末帧 同时匹配两端;提示词仅描述中间过程(journey)
Ref2VA Ref2VA 参考身份(reference identity)与顺序(ordering) 仅为该镜头分配其真正需要的参考素材

T2V 完全依赖提示词结构,因此请按如下顺序明确主体、动作、摄像机、环境与音频。I2V 从首帧图像继承构图;更改宽高比将导致本可避免的裁剪。FLF2V 锁定首尾两帧,因此应精简提示词,仅保留运动、时机、摄像机路径与声音描述。首帧与末帧指南 包含兼容的图像预处理方法及过渡修复技巧。

Ref2VA 支持更丰富的上下文预算——在受支持的工作流中,最多可接受九张图像、三段视频与三段音频参考——但“最多”并非目标。尽可能仅使用一至两张身份图像、一段运动视频与一段干净的音频参考。额外输入会相互争夺注意力,并加大调试难度。

结论

请牢记 MiniMax H3 基线设置为:768p、20 步、res_multistepsimple、引导系数为 1、偏移量为 12/3;仅在快速迭代阶段使用 0.5MP 与 4–8 步的 Turbo 渲染,待选定满意结果后,再将其迁移至托管式 2K 渲染以获取最终细节。根据所选模式匹配 FL2VA 或 Ref2VA,确保帧数符合 17n+5 网格,用带时间标记的方式描述音频源,并始终一次只调整一个参数。

准备好亲自试试了吗?

在 Seedance 中实践本指南的步骤,几分钟内将提示词或图片变成精致视频。

注册即送免费积分,套餐每月 $20 起。