打开生成器
MINIMAX H3 提示词结构

MiniMax H3 提示词结构

本地 H3 需要一份可以直接执行的音视频说明

MiniMax H3 同时生成画面和声音。官方指南把基础模式整理为三个固定字段。帧省会先生成一段便于阅读的草稿,再用“进一步优化”输出官方英文结构。

资料核对:。示例为本站原创写作稿,不代表统一模型实测结果。

直接记住目标时长 + 主体与动作 + 连续时间线 + 镜头句子 + 声音 + 一致性
30 秒看懂
  1. 01先确认 H3 的生成模式与总时长
  2. 02把动作写成连续的可观察变化
  3. 03分别说明画内声音与背景配乐
01

时长、参考帧与本地工作流先对齐

H3 官方仓库说明基础生成支持 4 至 15 秒。当前生成器提供 4、6、10、15 秒快捷选项。你需要让本地任务的真实时长与提示词一致,尤其要检查尾帧对齐时间。

你可以先用静音单镜头检查动作,确认后再加入声音。如果首帧里没有清晰的手或道具,你应先换构图,再测试精细拿取动作。提示词无法替代可见的参考细节。

02

H3 有五种模式,帧省当前先覆盖三种

当前生成器 的生成器支持 T2VA、I2VA 和 FL2VA。L2VA 与 Ref2VA 还需要收集尾帧用途和多项素材职责。网站不会在缺少这些信息时生成空标签。

  • T2VA:纯文字建立完整音视频时间线。
  • I2VA:首帧固定开场状态,提示词描述之后怎样发展。
  • FL2VA:首帧与尾帧固定两端,提示词描述中间路径。
  • L2VA:给定尾帧,提示词需要设计合理的前置状态。
  • Ref2VA:图片、视频和音频分别承担人物、动作、运镜、节奏或声音参考。
03

基础模式使用三个固定字段

integrated_multimodal_description 负责画面、主体、动作、镜头、对白和画内声音。overall_soundscape 汇总环境声、动作声和非语言人声。non_diegetic_music 单独说明只让观众听到的背景配乐。

官方指南要求结构化描述使用英文。对白、歌词和画面内文字可以保留原语言。没有非叙事配乐时,non_diegetic_music 使用 N/A;只有用户明确要求全片完全静音时,overall_soundscape 才使用 N/A。

I2VA 需要在三个字段前把 Picture 1 对齐到 0.00 秒和 Shot 1。FL2VA 需要把 Picture 1 对齐到 0.00 秒,并把 Picture 2 对齐到用户实际设置的视频结束时间。网页选择的时长必须与 H3 任务参数保持一致。

integrated_multimodal_description → overall_soundscape → non_diegetic_music
04

时间线需要交代起点、变化和结束状态

一个连续镜头可以分成建立、执行和收束三个阶段。动作描述需要说明初始状态、因果顺序、物体归属和最终停留位置。首尾帧模式还要逐步缩小与尾帧在姿态、位置、构图和光线上的差异。

官方运镜词同时区分类型、幅度和速度。提示词应把运镜写进完整句子,例如让摄影机以较小幅度和缓慢速度向主体推进。标签堆叠很难说明摄影机在空间中的实际路径。

初始状态 → 动作发生 → 状态变化 → 稳定落点
05

环境声、动作声和配乐需要分开

H3 会生成原生音频。创作者需要先决定画面里真实存在的声音,再决定观众是否听到额外配乐。咖啡馆的室内底噪、杯子碰触声和背景音乐承担不同职责。

帧省当前提供环境原声、仅动作音效、轻柔配乐、节奏配乐和完全静音。对白功能需要继续收集说话人、语言和原始台词,本版暂未自动生成对白标签。

06

同一创意的草稿版与 H3 结构版

下面的案例由帧省原创。草稿版便于先检查创意;结构版适合复制到本地 H3 工作流后继续修改。

草稿版先确认动作、镜头和声音方向

制作一段10秒的 MiniMax H3 视频。午后的安静咖啡馆里,一位穿深灰色套装的中年男性坐在桌前。他先低头看向白色咖啡杯,右手握住杯柄并平稳举到胸前,最后停住。中景缓慢推进,写实电影质感。保留室内环境声和杯子接触声,不使用背景配乐。

H3 结构版使用官方字段并补齐十秒时间线

integrated_multimodal_description: [Shot 1] Live-action, cinematic. The target video lasts exactly 10 seconds and remains one continuous shot. From 00:00.000 to 00:02.000, a middle-aged man in a tailored charcoal suit sits still at a wooden café table and lowers his gaze toward a white coffee cup. From 00:02.000 to 00:08.000, he leans forward slightly, reaches with his right hand, closes his fingers around the handle, and lifts the cup steadily to chest height while keeping it upright. From 00:08.000 to 00:10.000, he stops the movement and holds one stable final pose. The camera pushes in with small amplitude at slow speed from a medium shot, keeping his face, right hand, and cup in focus. Preserve his identity, clothing, cup geometry, hand-to-handle contact, light direction, and café layout throughout the shot. overall_soundscape: Soft café room tone, distant cup clinks, and the precise contact sound of the hand and cup; all physical sounds remain naturally synchronized. non_diegetic_music: N/A

07

提交前检查因果、空间和声音

创作者可以先问三个问题:物品在谁手里?动作通过哪条路径发生?声音在什么可见动作之后出现?例如,杯子应先离开桌面,杯底才会离开原来的接触点;放回桌面时,接触声应与触桌时刻一致。

创作者还应核对结束状态。人物拿起杯子后仍持杯时,结尾不能同时描述空手挥手。这个检查清单属于本站编辑建议,不代表已测得固定的成功率提升。

08

本地 H3 与官方 Context-IR 需要区分

MiniMax 官方把 H3-Context-IR、H3-Base 和 H3-Regenerate-2K 列为完整系统的三个部分。官方说明 H3-Context-IR 会理解并扩写自由文本和多模态输入。开源版本没有包含 H3-Context-IR 的实现;MiniMax 通过官方 API 提供这项服务。

帧省可以帮助本地用户把中文创意整理成公开的官方结构。帧省没有复现官方 Context-IR,也没有官方数据证明两者效果相同。

资料来源

模型功能会继续更新。涉及具体版本能力时,请同时核对当前官方页面。