MiniMax H3 首帧与末帧:如何精准控制 AI 视频两端

E
Emma Chen·阅读约 2 分钟·Aug 18, 2026
分享到 X
MiniMax H3 首帧与末帧:如何精准控制 AI 视频两端

AI 概览

什么是 MiniMax H3 首帧与末帧(FLF2V)?

MiniMax H3 FLF2V 接收一张起始图像和一张结束图像,然后在两者之间生成视觉运动及同步的立体声音频。您定义两个端点,而提示词则指导中间的演变过程。

首帧与末帧(FLF2V)与图像转视频(I2V)有何不同?

图像转视频仅锁定起始帧;而首帧与末帧则同时锁定首尾两帧,因此模型必须抵达一个特定的最终构图,而非自行生成一个结尾。

MiniMax H3 FLF2V 支持哪些图像格式与分辨率?

托管版 H3 工具支持常见的网页图像格式,包括 JPEG 和 PNG;输出宽高比将沿用首帧图像的宽高比。上传前,请确保两张图像尺寸与宽高比完全一致。

准备好亲自试试了吗?

注册即送免费积分,套餐每月 $20 起。

免费试用 Seedance

我能否在没有本地 GPU 的情况下使用 MiniMax H3 首帧与末帧?

可以。云端托管的 H3 端点可远程完成生成;本地用户若具备合适硬件,也可在 ComfyUI 中运行开源权重的工作流。

MiniMax H3 首帧与末帧实际执行的操作

MiniMax H3 首帧与末帧视频(FLF2V)将两张静态图像视为严格的视觉锚点:首帧固定为第 0 帧,末帧固定为目标终点。在二者之间,H3 规划运动轨迹、摄像机行为、光照变化、物体形变,以及原生立体声音频。例如:一朵闭合的花可绽放为盛开状态,正午街道可过渡至蓝调时刻,一个密封的产品包装盒可最终完全打开。

普通图像转视频仅有首帧锚点,因此结尾可能在姿态、构图、色彩或产品几何结构上发生偏移;而 FLF2V 显著缩小了这种不确定性。它并非简单地交叉淡入淡出——模型会合成一条两张构图之间合理可信的演化路径。这使得端点控制能力大幅增强;不过中间过程仍取决于图像与提示词之间的兼容程度。

官方 MiniMax API 首帧与末帧示例,展示双锚点 FLF2V 概念

来自官方 MiniMax API 文档的真实首帧与末帧配对示例。匹配的 16:9 帧为模型提供了从起始人像到最终人像的清晰演进路径。

应用场景 —— 何时双锚点优于单锚点?

当结尾镜头与起始镜头同等重要时,双锚点最具价值:

应用场景 首帧 末帧 H3 规划内容
产品揭晓 封闭包装 产品完全展开呈现 开启动作、交接过程、高光展示、音效设计
时间过渡 日出街景 夜间天际线 光照、车流、天空与环境氛围变化
角色动作 直立姿态 受控落地 身体运动路径、布料动态、冲击效果、镜头跟随
分镜衔接 已批准镜头 A 已批准镜头 B 连接两个分镜面板的过渡镜头
前后对比广告 原始房间 完成翻新后的房间 材质与空间布局的转化

下方官方 H3 示例为已生成完成的视频片段,而非概念示意。注意固定不变的双筒望远镜遮罩与反复出现的红色元素为模型提供了强连续性线索,同时镜头在预设时刻之间平稳扫描。

MiniMax H3 首帧与末帧 · 官方生成的品牌影片示例

如何使用 FLF2V —— 通过 MiniMax API 与 Seedance 的分步指南

  1. 准备两张兼容图像。 将两张图像裁剪为相同宽高比与尺寸。保持主体比例、摄像机轴向及主要几何结构足够接近,以确保过渡自然可信。
  2. 描述动作,而非外观。 图像本身已定义主体与视觉风格。请撰写连接两帧所需的动作、节奏、摄像机运动及音频提示。
  3. 提交两个端点图像。 托管版 H3 请求需提供起始图像及 end-image 字段;在浏览器工作流中,请遵循 Seedance 首帧与末帧指南,并按顺序上传两张帧图像。
  4. 生成短时测试片段。 从最短但仍有意义的时长开始。检查中间部分是否存在身份漂移、意外淡入淡出、物体突现(popping)以及与动作矛盾的音频。
  5. 每次仅调整一个变量。 若演进路径错误,请优先简化动作提示词,而非替换已验证有效的端点图像。

若您仅需为一张已批准的产品或角色图像制作动画,且不关心结尾的确切形态,则更简单的 Seedance 图像转视频工作区 通常更快捷。

在 ComfyUI 中运行首帧与末帧(FLF2V)

构建工作流前,请先更新 ComfyUI;本工作流基于 v0.30.0 或更高版本。加载 H3 FL2VA 扩散模型、兼容的 Qwen3-VL 文本编码器与 VAE,再添加原生 MiniMaxH3ImageToVideo 条件节点。将两张解码后的图像输入分别连接至 first_framelast_frame,设置目标宽高,并在 H3 的 17k+5 帧网格中选择有效帧数。常见五秒测试为 24fps 下的 124 帧。

请确保两张输入图像的宽高比与潜在空间(latent)一致。H3 的引导蒸馏采样器(guidance-distilled sampler)默认使用 guidance 1;提高常规 CFG 值反而可能降低稳定性,而非提升效果。完整的 MiniMax H3 ComfyUI 配置指南 详述了基础文件与节点连接顺序。

为加快迭代速度,可添加兼容的 Turbo 适配器,并先以四步推理进行测试,再逐步增加步数。MiniMax H3 Turbo LoRA 指南 展示了加载器位置与推荐强度值。Turbo 有助于预览过渡效果,但最终质量输出仍可能受益于基础工作流。

适用于两个固定帧的提示词写作方法

端点图像(即首尾两帧)已明确回答了“呈现什么内容”。一个有效的 FLF2V 提示词则需说明镜头在二者之间“如何运动”:包括主体动作、运动速度、摄像机路径、环境变化以及声音设计。应避免重复描述所有视觉细节,否则可能与提供的固定帧产生冲突。如需更广泛的语法结构与摄影术语参考,请查阅 MiniMax H3 提示词指南

产品展示类:
摄像机以缓慢匀速完成 30 度环绕运镜,同时盖子以单次连贯动作开启;一道柔和高光沿金属表面滑过;全程无剪辑、无叠化。铰链运动精准,录音棚环境音安静,锁扣闭合时发出轻微而清晰的“咔嗒”声。

日转夜过渡类:
保持摄像机位置固定;时间自然流畅地从温暖的傍晚过渡至蓝调时刻;实景灯光逐盏亮起,车流持续自然流动,远处城市环境音略微增强。

角色落地类:
角色自画面上方垂直坠入,空中完成一次完整翻转,最终以蹲姿稳稳落地;摄像机同步下倾,并在触地瞬间平缓停止;大衣与头发依真实惯性跟随运动;仅包含一次干净利落的落地音效。

此类提示词聚焦于运动方向与节奏感,而不重述固定的服装、场景或产品外观。仅在失败将直接破坏转场效果的关键处,才使用明确的连续性表述——例如 单次连贯镜头无剪辑保留 Logo

限制条件、已知问题及应对方案

问题 成因 实用解决方案
端点画面裁切或跳变 图像采用不同宽高比或主体缩放比例 统一画布尺寸;上传前对齐地平线、视线高度及主体中心点
中段出现形变(Morphing) 两帧暗示了无法实现的几何结构变化 缩小视觉差异幅度,或增加中间帧生成步骤
结尾抵达感薄弱 短暂时长内塞入过多动作,导致焦点分散 仅保留一项核心动作,并预留最后一秒用于动作收束与稳定
出现非预期的淡入淡出(Crossfade) 提示词描述了状态转变,但未指明物理运动机制 明确命名运动方式:如 开启旋转展开行走摄像机横摇
音频节奏错位 音频随运动生成,而非帧率锁定 仅请求一个简单音效提示,并在后期制作中替换关键音频
时长不匹配 本地 H3 遵循 17k+5 帧网格规则 使用有效帧数,例如 24fps 下的 124、209 或 294 帧

最常见的失败根源,是要求两张图像代表截然不同的世界。一张居中构图的影棚包装静物图,无法在一段短片中自然演变为一幅广阔的户外动作场景——除非强行引入虚构的几何结构。FLF2V 最擅长的场景,是两端点在状态、姿态、光照或摄像机位置上存在差异,但仍共享一致的主体与空间逻辑

结语

当视频必须严格始于并终于已批准的视觉画面时,MiniMax H3 的“首尾帧模式(First-and-Last-Frame Mode)”即为最佳选择:确保两帧精准对齐,仅描述其间发生的运动,先测试简短转场效果,并简化一切可能导致形变或跳变的元素。若追求生成速度,请使用云端服务;若需本地精细控制,请选用 ComfyUI;当你准备好将两个关键帧直接转化为可投入广告战役使用的成片,且无需配置本地 GPU 时,立即使用 Seedance 创建你的下一个视频 →

准备好亲自试试了吗?

在 Seedance 中实践本指南的步骤,几分钟内将提示词或图片变成精致视频。

注册即送免费积分,套餐每月 $20 起。