MiniMax H3 提示词指南:如何写出更好的 H3 提示词
Yifan Zhao9 分钟阅读 ·

优秀的MiniMax H3 提示词应像精炼的制作指令,而不是冗长的电影风格关键词清单。 好的提示词会明确每份参考素材控制什么、事件发生的先后顺序、镜头如何移动、应听到什么,以及哪些细节必须保持不变。如果你正在学习如何使用 MiniMax H3,优化提示词的关键与其说是增加描述,不如说是消除歧义。
结构不佳的提示词往往会导致角色偏移、动作遗漏、首尾帧衔接薄弱、台词错误或产品几何形状变化。我们对公开的MiniMax H3 工作流程及常见用户问题进行梳理后发现,这些失败通常源于参考素材冲突、时间线过载、模糊的镜头语言或不明确的保留规则。更全面的MiniMax H3 评测也有助于明确哪些生成任务最能受益于更严谨的提示词结构。
Virse将 AI 带入无限画布,而不是把创作局限在聊天框中,旨在让这一过程更直观、更便于协作。设计师可以整理参考素材、连接资产、运行共享项目上下文的多个 AI 智能体,并在多轮迭代中保留风格偏好和团队知识。因此,当 H3 提示词成为更大规模的专业 AI 设计工作流程的一部分,而不只是单次提示词实验时,Virse 尤其有用。

最佳的 MiniMax H3 提示词结构是什么?
可靠的MiniMax H3 提示词结构可以分为七层:参考素材分工、时间线、视觉效果、镜头、声音、准确文字和限制。并非每个提示词都需要全部七层,但当生成结果难以控制时,这种结构能提供一份实用的检查清单。
要素 | 控制内容 | 最佳实践 |
|---|---|---|
参考素材分工 | 身份、产品、风格、动作、声音 | 为每份输入指定一个明确的任务 |
时间线 | 动作顺序与状态变化 | 按播放顺序描述事件 |
视觉效果 | 光线、材质、环境 | 使用可观察到的视觉细节 |
镜头 | 取景与运动 | 每个镜头使用一种主导的镜头思路 |
声音 | 台词、环境音、音乐 | 分开描述每个音频层 |
准确文字 | 标签、标牌、界面、标志 | 准确指定重要文字 |
限制 | 哪些内容不得改变 | 使用范围明确、针对具体任务的约束 |
MiniMax 现有的 H3 API 支持以 768P 或 2K 生成 4–15 秒视频。参考生成最多可使用九张图片、三段视频和三段音频,混合参考文件总计最多 12 个。这种灵活性很强大,但也意味着,如果没有明确各自的作用,输入越多就越可能产生冲突。

应该如何为 H3 参考素材分配作用?
不要附上几份参考素材后只让 H3“使用它们”。告诉模型每份素材控制什么。
对于产品营销活动,提示词可以明确:图片 1 控制模特身份,图片 2 控制服装,图片 3 控制摄影棚环境,产品图片控制准确的几何形状和材质,参考视频控制动作节奏。
在专业设计工作流程中,我认为参考素材的分工比数量更重要。额外的图片只有在消除不确定性,而非引入另一种相互竞争的视觉方向时才有价值。同样的原则在MiniMax H3 动作迁移中尤其重要,因为身份、动作、镜头等属性可能来自不同参考素材。
H3 中 Picture 和 Subject 有什么区别?
在 MiniMax 的全参考提示系统中,Picture更像一份具体的视觉或构图参考,而Subject表示从参考素材中提取的可复用内容,例如角色、物体、环境、服装、姿势或风格。
当同一项目同时包含构图参考和身份参考时,这一区别很重要。如果分镜格控制取景,而角色设定表控制身份,就应将这些作用分开。否则,H3 可能会尝试保留错误输入中的错误特征。
如何编写 MiniMax H3 时间线提示词?
好的MiniMax H3 时间线提示词的核心是:
当前状态 → 可观察的动作 → 镜头响应 → 最终状态。
MiniMax 的官方 H3 提示指南按时间顺序描述视频生成,这种方式很有用,因为视频质量取决于模型对随时间发生的变化理解得有多好。
H3 提示词需要时间戳吗?
不需要。与时间戳相比,H3 更需要清晰的时间顺序。
对于简单的产品镜头,提示词可以这样写:
香水瓶保持在湿润黑色石面的中央。一只手从右侧伸入,拿起瓶子,缓缓朝温暖的主光方向转动,并在金色标签映出高光时停下。镜头全程缓慢、小幅度推进。
当你加入多次切镜、同步台词、变形或多个重要节拍时,时间戳会更有用。
我们梳理 H3 工作流程问题时发现一种反复出现的模式:模型遗漏动作时,创作者往往会添加更多指令。这通常会让时间线更难执行。减少同时发生的动作,并明确结束状态,往往更有效。
H3 提示词应包含多少个动作?
官方没有规定节拍数量上限,但实用的规划范围是:
- 5 秒:一到两个有意义的节拍
- 10 秒:两到四个节拍
- 15 秒:三到五个节拍
这些是工作流程中的经验法则,并非模型限制。每个节拍应代表一次有意义的视觉变化。
例如,一则 10 秒运动鞋广告可以展示运动员系紧鞋子、起身进入起跑姿势,再加速跑过镜头。与在同一短片中组合六个动作、多次镜头移动、场景变换和标志亮相比,这样更容易控制。

如何使用 MiniMax H3 参考图片、角色设定表和分镜?
将身份、构图、动作和风格视为分别需要控制的问题时,H3 参考提示的效果最好。这对使用角色设定表、产品参考、分镜或动作参考的设计师尤其重要。
角色设定表能改善 H3 的一致性吗?
可以,尤其是设定表明确呈现了面部、发型、比例、服装、配饰和独特特征时。
我们评估的一套公开参考生成视频流程中,使用 Flux 创建的角色设定表,在该特定配置下无需单独的角色 LoRA,就足以达到创作者的目标效果。这并不能证明角色设定表总能替代 LoRA,但说明了结构清晰的身份参考为何能简化制作流程。
对整个工作流程更重要的启示是:将身份控制与镜头规划分开。
如何在 H3 中使用分镜?
分镜应传达镜头顺序和构图,而不是充当含糊的多用途参考。
如果一张图片包含多个分镜格,要明确对应关系:
第 1 格指导镜头 1。第 2 格指导镜头 2。第 3 格指导镜头 3。角色身份沿用角色参考,分镜仅用于取景与顺序。
我们梳理用户问题后发现,当 H3 需要猜测一张图片究竟是起始帧、角色设定表、情绪板还是序列参考时,分镜跳过问题会反复出现。
如何控制 H3 的镜头、音频和首尾帧?
许多技术上正确的提示词,仍会在镜头、声音和转场方面失去创意控制。
如何编写 H3 镜头提示词?
使用具体的物理镜头语言,而不是“电影感”之类的装饰性词语。
MiniMax 的 H3 指南支持推进、拉远、水平摇镜、垂直摇镜、横移、跟拍、弧线移动、升降、手持和固定镜头等运动。实用的镜头指令会描述运动类型、速度、幅度和目标。
例如:
中近景。秒针开始转动时,镜头缓慢、小幅度地向表盘推进。
想让画面更自然,可观察到的不完美也会有帮助:轻微手持晃动、自动对焦延迟、曝光反复调整、镜头水滴、颗粒、光晕或色散边缘。
如何为 H3 首尾帧编写提示词?
不要只描述起始与结束图像。要描述它们之间的物理过渡。
以撑开雨伞为例:
角色举起收拢的雨伞,将伞巢向上推,伞骨向外展开,折叠的伞面逐渐张开,雨伞最终完全打开,随后静止。
最可靠的模式是:
起始状态 → 中间变化 → 渐进过渡 → 准确的结束状态。
这适用于包装揭示、产品旋转、界面转场、姿势变化和动态图形序列。
如何为 H3 音频与台词编写提示词?
将声音分为三个独立层次:
台词:谁说话、说什么。
场景声音:脚步、雨声、物体移动声、室内底噪。
音乐:乐器配置、速度、节奏和强度。
对于反复出现的说话者,跨镜头保持说话者身份一致。如果不需要音乐,要写明无音乐,而不是不指定音频方向。
对于可见文字,准确指定重要措辞,并使用范围明确的约束,例如不添加其他文字、无字幕或保留产品标签。
真实 H3 工作流程测试说明了哪些迭代成本问题?
提示词质量也是制作效率问题。每次错误理解都会增加一轮渲染。
为什么应先以低分辨率测试 H3 提示词?
我们评估的一套公开工作流程使用0.2MP、八步采样验证构图与事件流。另一套 RTX 5080 流程报告称,渲染 10 秒 720p 视频大约需要10 分钟,而 0.2MP 预览约需三分钟。

这些数字是特定环境下的工作流程报告,并非 MiniMax 基准测试。其价值在于实践:低分辨率预览可以在最终渲染前,以低成本回答一些问题。
角色是否仍然可辨认?
事件是否按正确顺序发生?
镜头运动是否正确?
分镜对应关系是否有效?
对于 ComfyUI 用户,这提供了一种实用模式:先验证结构,待提示词遵循程度达到要求后,再增加步数和分辨率。
更多步数总能改善 H3 结果吗?
改善程度未必足以抵消额外的迭代成本。
一套 768×1280 工作流程报告,在 20 步下,大约需要2 分钟生成 5 秒、6 分钟生成 10 秒、12 分钟生成 15 秒。另一套流程报告,在其环境中,将 20 步减至 10 步节省了约40% 的生成时间。

另一则 RTX 5070 Ti 参考生成视频案例报告,采样约需 121 秒,但总计 362 秒,说明采样本身并非唯一瓶颈。
关键启示并不是硬件的准确速度。提示词遵循度可能比纯粹的生成速度更重要,因为不明确的指令会成倍增加总制作时间。

为什么 MiniMax H3 不遵循我的提示词?
大多数 H3 失败都可以追溯到某个具体的歧义。
为什么角色或产品一直在变化?
可能原因:参考素材相互竞争,或保留优先级不明确。
修正方法:选择一份权威的身份或产品参考。准确说明必须保持不变的内容,例如面部、服装、瓶身几何形状、标签位置、材质或颜色。
为什么 H3 会跳过分镜镜头或动作?
可能原因:时间线过载,或分镜格对应关系不明确。
修正方法:减少节拍数量,将每个分镜格对应到一个镜头,并为每个镜头指定一个主导动作和一种主导镜头思路。
为什么说话的是错误的角色?
可能原因:说话者对应关系不完整。
修正方法:保持说话者身份稳定,将声音参考与目标说话者关联,并将台词指令与环境音、音乐分开。
为什么屏幕文字不正确?
可能原因:文字定义不够明确,或过多文字元素相互竞争。
修正方法:提供准确文字,指出出现位置,并禁止不必要的附加文字。对于对品牌至关重要的排版或标志,在投入生产使用前,仍应人工检查最终输出。
适用于专业设计工作流程的 MiniMax H3 提示词模板
大多数 H3 项目可采用以下顺序:
视觉方向 → 参考素材分工 → 时间线 → 镜头 → 声音 → 准确文字 → 限制
产品提示词可以这样写:
高端实拍产品影片。产品参考控制准确的瓶身几何形状、玻璃材质、标签位置和瓶盖颜色。瓶子立在湿润黑色石面上,窄束温暖侧光照射。一只手缓缓拿起瓶子并朝光线转动,同时镜头小幅推进。水滴沿玻璃向下移动。标签朝向镜头时停下。保持瓶身比例。不添加其他产品、额外标志、字幕或切镜。
对于复杂的多模态项目,MiniMax 还记录了一种更完整的参考结构,涵盖主体定义、摘要、保留分析、详细描述、整体声景和非叙事内音乐。其官方指南建议,复杂生成任务的详细描述部分约为350–500 个英文单词。当多个角色、参考素材、声音或保留规则需要互相配合时,这种细节程度很有用,但并非每个普通 H3 提示词都需要。
常见问题
H3 的每个提示词都需要时间戳吗?
不需要。清晰的播放顺序比时间戳更重要。连续镜头只需按时间顺序描述动作。当短片包含多次切镜、同步台词、变形或必须在特定时刻发生的多个重要节拍时,时间戳才更有用。
H3 提示词应该多长?
不存在通用的理想长度。简单镜头只应包含足以消除重要歧义的信息。复杂的全参考流程则可能需要长得多的描述。提示词长度本身并非质量指标;信息层级和清晰度更重要。
角色设定表可以替代 H3 中的 LoRA 吗?
有时可以,但并非普遍适用。我们评估过一套流程,角色设定表在没有单独角色 LoRA 的情况下,达到了可接受的参考生成视频一致性。这并不能确立通用基准。在移除其他身份控制手段之前,应测试角色在不同姿势、取景、光线和镜头角度下的表现。
可以在低分辨率下找到种子,并以高清复现吗?
使用低分辨率生成来测试提示词理解、构图、动作和事件顺序,但不要假定改变分辨率或流程设置后,同一个种子会复现完全相同的结果。应将低分辨率预览视为方向验证工具,而不是保证与最终渲染相同的缩小版本。
结论
最可靠的 MiniMax H3 提示策略是减少模型需要猜测的内容。为每份参考素材分配明确作用,按播放顺序描述动作,使用具体的物理镜头语言,说明首尾帧之间的运动,将台词与场景声音、音乐分开,以范围明确的约束保护重要文字和设计属性,并在最终渲染前低成本验证序列。对于设计师和创意团队,这会将MiniMax H3 提示词编写从反复试错的关键词写作,转变为围绕身份、时间、动作、声音和保留要求构建的可重复创意指导流程。
更多 Virse 博客文章
工作流

GPT Image 2.5 Noise and Oversharpening: Why Some Images Still Look AI-Generated
2026年10月9日 by Yifan Zhao
工作流

GPT Image 2.5 Keeps Changing My Image: How to Use a "Keep List" for Reliable Edits
2026年10月9日 by Yifan Zhao
工作流

GPT Image 2.5 Editing Drift: Why Images Get Blurry, Cropped or Worse After Multiple Edits
2026年10月9日 by Yifan Zhao