- 博客
- MiniMax H3 AI Agent 技能:安装、提示词编写与运行视频工作流
AI 概览
什么是 MiniMax H3 AI 智能体技能(AI agent skill)?
它是一个可复用的指令包,帮助 AI 智能体将粗略的视频创意和参考媒体素材转化为结构化的 H3 提示词(prompt)。它不替代视频生成模型。
如何安装官方 H3 提示词撰写技能?
使用兼容的 Skills 安装器,从官方 MiniMax H3 仓库安装 h3-prompt-writing。随后确认其 SKILL.md 文件及提示词参考文档可正常读取。
H3 提示词撰写技能会生成视频吗?
该便携式提示词撰写技能仅准备指令,不发起任何外部 API 调用。视频渲染仍需通过 H3 应用、API、本地部署或生产流水线完成。
应选用哪种 MiniMax H3 工作流?
- 使用文本模式(text mode) 处理初步创意;
- 使用首/尾帧模式(first/last-frame mode) 实现受控转场;
- 当需保留图像、视频、音频、身份特征、运动轨迹或节奏感时,使用参考模式(reference mode)。
MiniMax H3 AI 智能体技能实际所做之事
搜索者常混淆“技能(Skill)”、“智能体(agent)”、“H3 模型”与“渲染服务”。仅安装提示词撰写 Skill 不会生成 MP4 文件。
| 层级 | 功能 | 用户提供内容 | 返回内容 |
|---|---|---|---|
| 智能体(Agent) | 解析请求并协调任务执行 | 目标、文件、约束条件 | 执行计划与工具调用指令 |
| 技能(Skill) | 教导智能体如何组织 H3 工作流 | 简报(brief)与参考素材的角色定义 | 可直接投入生产的提示词 |
| H3 模型 | 同步生成视频与音频 | 结构化上下文 | 渲染出的帧序列与声音 |
| 应用、API 或本地服务 | 提交、监控并交付任务 | 提示词、媒体素材、设置参数 | 任务状态与最终输出文件 |
便携式提示词撰写 Skill 与仅限 Hub 的创意型 Skill 对比
官方仓库包含一个便携式 h3-prompt-writing Skill,以及八个面向特定风格的生成器。该便携式 Skill 以 Markdown 编写,附带参考指南,且不发起任何外部 API 调用;而风格生成器依赖 MiniMax Hub 画布工具——将其文件夹直接复制到通用智能体环境中,无法复现原有运行环境。
Skill、模型与 API 的区别
请将 Skill 视为生产知识,而非隐藏模型。它教导智能体识别主体、动作、镜头、时间节奏、音频、参考素材角色及各类约束条件。模型负责实际生成,API 或应用则负责提交与结果获取。这种职责分离使故障更易诊断。
谁应使用该工作流?
该流程适用于以下两类用户:
- 创作者:需批量制作可复用的产品广告、角色镜头、音乐视频或品牌场景;
- 开发者:追求输入参数的一致性与可复现性。
若仅需生成单个简单镜头,直接从 文本生成视频 入手可能比叠加智能体层更高效。
安装并验证 H3 提示词撰写 Skill
安装前提条件
需使用支持发现本地 Skill 并能读取 SKILL.md 文件的智能体环境。同时需安装 Node.js 与 npm,以运行安装命令。该便携式提示词撰写 Skill 本身无需 H3 API 密钥,因其不提交付费生成请求。
从官方 GitHub 仓库安装
在终端中运行官方安装命令:
npx skills add https://github.com/MiniMax-AI/MiniMax-H3 --skill h3-prompt-writing
若智能体缓存了 Skill 目录,请重启或刷新智能体。随后要求其按名称列出已安装的 Skill。成功安装后,应能访问主说明文档及两份参考指南:一份面向文本/关键帧工作流,另一份面向全参考工作流。
运行前检查 Skill 内容
打开 SKILL.md,核查其激活规则、输入模式、参考资源及输出格式。确认其中是否包含任何 shell 命令、上传操作、密钥或 API 调用。此举可防止将纯提示词 Skill 误认为具备渲染能力的组件。
从简报到最终视频:运行 H3 智能体工作流
步骤 1:向智能体明确生产目标
避免使用“制作一段精彩视频”等模糊表述,代之以一项具体任务:例如产品亮相、角色登场、音乐插入或竖屏营销钩子(vertical campaign hook)。同时明确目标受众、输出格式、时长及验收标准,为智能体设定清晰的完成边界。
步骤 2:为每份参考素材指定唯一角色
参考素材之间不应功能重叠。请为每个文件命名并明确定义其作用:一张肖像图控制身份特征,一张产品图控制几何形态,一段运动片段控制动态表现,一份音频文件控制节奏或环境氛围。当单个文件承担多重角色时,须说明各项细节的优先级及哪些部分允许变动。

一项实用的参考测试,是追踪同一产品从干净利落的主视觉图,到手持交互细节,再到真实世界使用场景的全过程;颜色、铰链形状、材质与比例应在每一处剪辑切换中得以保留。
步骤 3:由 Skill 构建结构化提示词
高质量的 H3 提示词需涵盖主体、场景、动作、镜头路径、时间顺序、音频、不可变细节及最终画面状态。请要求智能体明确区分源自参考素材的事实信息与创意性补充内容。此举可加快审核速度,并防止智能体在未经许可的情况下擅自修改已批准的产品或角色设定。
步骤 4:渲染、审阅并逐项修订
通过您的 H3 接入界面(surface)提交提示词。审阅内容包括运动表现、构图、身份一致性、材质细节、音频质量及最终帧效果。每次重试仅调整一个变量,以便精准定位改进点;成功修正后,请将该配置保存至项目模板中。
选择合适的 H3 输入模式
文本生成视频:适用于以创意为先的生成场景
当尚无已批准的源帧,且目标是进行视觉探索时,请选用文本模式(text mode)。先用清晰的动作描述与镜头运动定义单个镜头,再添加次要氛围元素。若需对同一简报生成多种诠释方案,可采用 多模型 AI 视频工作流,将提示词分发至不同生成器并横向比对经批准的输出结果。
首帧与末帧工作流:实现可控转场
当开场镜头、收尾镜头,或两者均需固定时,请使用首帧/末帧模式。两幅图像应在主体比例、场景几何结构及视觉风格上保持合理一致。提示词应着重描述两帧之间的物理性过渡过程,而非重复描绘画面中已明确呈现的内容。

可控帧工作流应具备清晰可读的叙事路径:起始姿态稳定、中间动作符合物理规律、终态姿势精准匹配预期终点。
您可先在 图生视频(image to video) 中生成开场构图,再复用此处的评估方法:检查解剖结构合理性、布料运动自然度、足部与地面接触状态、摄像机稳定性,以及结尾是否自然抵达。
参考图生视频(Reference-to-video):用于身份、动作与音频控制
当任务依赖于可识别的人物或产品、已示范的动作、特定视觉风格,或精确的音频节奏时,参考模式最为适用。请仅选用最小但强效的参考素材集,以覆盖上述各项需求。参考文件数量增多并不自动增强控制力;反而可能引入相互矛盾的线索。
快速模式选择对照表
| 您已拥有的输入 | 推荐模式 | Agent 应提取的关键要素 | 常见失败原因 |
|---|---|---|---|
| 仅有文字创意 | 文本生成视频(Text-to-video) | 主体、动作、镜头、声音 | 提示词试图囊括多个镜头 |
| 一张已批准图像 | 首帧视频(First-frame video) | 首帧之后的不变量与运动特征 | 对静态图像过度重述 |
| 已批准的起始帧与结束帧 | 首帧/末帧(First/last-frame) | 过渡路径与时间节奏 | 起止点在物理层面不兼容 |
| 身份、动作或音频参考素材 | 参考图生视频(Reference-to-video) | 每个参考资产对应一项明确职责 | 参考素材彼此冲突或稀释主优先级 |
构建面向真实生产的可复用 H3 技能(Skill)
产品广告工作流
为产品图像、目标受众、发布平台、钩子(hook)、时长、画幅比、必须保留的细节、禁止出现的宣传主张等要素创建变量。该 Skill 应主动询问缺失的关键项,随后输出简明扼要的分镜脚本、结构化提示词,以及审查清单。此方式远比存储一个巨型“完美提示词”更具复用性。
角色一致性工作流
定义身份锚点(identity anchors)——包括面部、发型、年龄、服饰、身体比例、标志性道具——并将其与可能变化的元素(如表情、姿态、镜头距离、光照)明确区分开。渲染完成后,应在最广角镜头、最快动作瞬间、以及最暗场景下比对角色身份一致性,而不仅限于干净的人像特写帧。
团队变量与审批规则
将版本化的输入信息存于对话之外:文件名、权限、提示词修订记录、模型设置、输出 URL、审核人、审批状态。增设中断条件,当缺失必要授权或参考素材存在冲突时自动中止流程。
将 H3 接入多模型视频管线
一个 Agent 可按镜头需求智能路由:将关键帧任务交由图像模型处理,将强参考依赖型镜头交由 H3 处理,将独立的电影感场景交由 Seedance 处理,将对白审核交由支持原生音频的 AI 视频生成器完成。依镜头需求进行路由,比强制单个模型承担整套营销视频任务更可靠。
播放该 8 秒参考测试视频,观察角色身份、乐器几何结构、鼓槌击打接触点、镜头运动变化,以及原生鼓声在整个序列中是否始终保持连贯统一。
质量、安全与排错核查清单
技能运行成功,但输出效果仍较弱
请检查:动作是否具备明确的起始、变化与终止阶段;摄像机运动是否具有一条清晰可辨的路径;音频指示是否具体明确。格式良好但内容空泛的提示词,本质上仍是空泛的。应先将镜头精简至其核心节拍(essential beat),待运动逻辑验证有效后,再逐步添加细节。
参考素材彼此冲突
剔除近似重复项,并为身份、产品几何结构、动作、风格、声音等维度分别指定唯一权威参考源。若两张图像对服装或身体比例的呈现存在分歧,请明确声明以哪张为准;若一段动作参考视频同时改变了镜头与动作本身,请决策是否需同步迁移这两种行为。
Agent 无法渲染视频
首先确认所安装的软件包是否仅为纯提示词(prompt-only)类型。随后依次排查:模型访问权限、认证凭据、API 端点、上传支持能力、文件权限、内容审核策略,以及任务状态。对于自托管管线,硬件、依赖项与存储故障属于基础设施问题,与提示词质量无关;可参阅本地 vs. 云端 AI 视频生成器指南,以准确定位该类架构选型问题。
最终生产核查清单
在批准前,请全面复核以下项目:角色身份、产品几何结构、手部表现、表面接触关系、镜头连续性、音画同步性、参考素材授权、画幅比、时长、导出完整性。保留所有失败输出及其原因;已通过与被拒案例的持续积累,可将通用 Skill 转化为可落地的生产知识库。
结论
MiniMax H3 AI Agent 技能的最大价值,在于作为一座可重复使用的桥梁,将模糊的创意需求转化为可直接交付渲染的视频简报(video brief)。请安装官方提示词编写工具包,明确其未覆盖的自动化环节,为每个参考素材分配唯一职责,正确选用 H3 模式,并将成功的修正方案保存为可复用规则。若您希望在同一结构化简报基础上横向对比其他影视级生成器的表现,请使用 Seedance 创建首个镜头,并从成本、镜头连续性、动作质量、审批耗时等维度展开综合评估,而非仅依据单条展示样片做判断。
准备好创作自己的 AI 视频了吗?
使用 Seedance 将创意、文字提示和图片变成精致视频。如果本文对你有帮助,下一步就是亲自试用产品。
注册即送免费积分,套餐每月 $20 起。

2026 年最佳 HeyGen 替代方案:免费、开源、虚拟形象与 API 选项
对比最佳 HeyGen 替代方案,涵盖 AI 虚拟形象、免费计划、开源控制、视频翻译、API、口型同步质量以及每条可用视频的成本。
阅读文章
本地 vs 云端 AI 视频生成器:成本、质量、隐私及如何选择
从成本、质量、速度、隐私、硬件要求、免费额度限制以及工作流适配性等方面,对比本地与云端 AI 视频生成器。结合决策对照表与真实生产环境测试结果,助您做出选择。
阅读文章
2026 年最佳 Vidu AI 替代方案:6 款免费与付费选项
对比最佳 Vidu AI 替代工具,涵盖图像转视频、逼真运动效果、视频编辑、特效以及免费试用功能。评估生成质量、定价策略与输出一致性。
阅读文章