MiniMax H3 参考指南:图像、视频与音频详解
Yifan Zhao9 分钟阅读 ·

MiniMax H3 参考素材让创作者通过不同来源素材控制视频的外观、运动方式与声音。图像最适合身份、服装、产品与环境;视频适合动作、表演、镜头行为与节奏;音频适合音色、音乐、节拍与声音特征。这些控制在MiniMax H3 动作迁移中尤其重要,因为不同参考素材可以分别负责身份、动作、镜头和声音。
难点在于避免这些参考素材相互竞争。动作视频可能串入外观信息,多张图像可能争夺身份定义权,而 Ref2VA 可能用视觉清晰度换取更灵活的参考控制。实际中,应在生成前明确每份参考素材应保留、迁移和忽略哪些内容,才能获得更好的结果。结构清晰的MiniMax H3 提示词与可重复执行的MiniMax H3 工作流让这些职责更容易控制。
对于希望扩大这些工作流规模的团队,Virse将参考素材、资产与多个 AI Agent整合到同一个无限画布中,共享创意上下文与长期视觉记忆。Virse 让创作者在一个画布上使用 Nano Banana 2、GPT Image 2、Seedance 2.0 等 50 多个模型,帮助把参考驱动的生成扩展为更全面的AI 设计工作流。新用户可以通过免费积分开始使用,付费套餐则为更大规模的制作工作流解锁高级模型,以及指定快速模型的无限使用权限。

什么是 MiniMax H3 参考素材,它们如何工作?
MiniMax H3 参考素材是用于向新生成内容提供特定属性的图像、视频或音频资产。使用 H3 最可靠的思路是关注参考素材的职责,而非文件类型。
参考素材 | 最适合 | 典型作用 |
|---|---|---|
图像 | 稳定的外观 | 身份、服装、产品、环境 |
画面锚点 | 特定视觉状态 | 构图、取景、开始或结束状态 |
视频 | 随时间变化的行为 | 动作、表演、镜头、节奏 |
音频 | 声音特征 | 人声、音乐、节奏、音质纹理 |
简单的制作分工可以是:图像 1 负责身份、图像 2 负责服装、视频 1 负责编舞、视频 2 负责运镜、音频 1 负责音色。这种“一份参考素材、一项主要职责”的方法不是技术限制,而是减少歧义的实用做法。
MiniMax H3 参考素材限制
规划工作流时,H3 官方规格同样重要。
输入或输出 | 限制 |
|---|---|
参考图像 | 最多 9 张 |
参考视频 | 最多 3 段,每段 2–15 秒,总计 15 秒 |
参考音频 | 最多 3 段,每段 2–15 秒,总计 15 秒 |
混合参考文件 | 最多 12 份 |
仅音频 Ref2VA 输入 | 不支持 |
输出时长 | 4–15 秒 |
输出帧率 | 24 FPS |
原生音频 | 32 kHz 立体声 |
实际含义很简单:可使用的参考素材数量,超过了大多数项目真正应该使用的数量。从能清楚定义镜头的最小素材集合开始。

MiniMax H3 图像参考如何控制身份与外观?
MiniMax H3 图像参考最适合控制在各帧中应保持视觉可辨识性的属性,包括面部、发型、服装、产品几何结构、材质、环境与视觉风格。
MiniMax H3 主体参考与画面锚点对比
主体参考代表可重复使用的人物或物体。画面式锚点则更接近一个具体构图或视觉状态。
当需求是“保留这个角色或产品”时,使用面向主体的参考。当需求是“从这张特定图像开始或结束”时,使用面向画面的工作流。
角色与产品一致性
对于角色,一份干净明确的身份参考通常比多张相互不一致的人像更有用。发型、年龄、服装或比例相互冲突,会削弱身份保留效果。
产品需要更严格的约束。即使镜头很有电影感,只要标志位置移动或轮廓改变,就仍然无法使用。品牌项目应明确保留比例、标志位置、材质、颜色与独特结构细节。
MiniMax H3 视频参考如何控制动作与镜头?
视频参考最适合随时间展开的信息:身体动作、编舞、表演、手势节奏、镜头路径、节拍、切镜与剪辑节奏。
MiniMax H3 身份迁移与表演迁移对比
Ref2VA 最有效的模式之一是:
图像 A 定义角色是谁。视频 B 定义角色做什么。
例如,时尚工作流可以用一张图像定义身份,另一张定义服装,一段视频提供走路表演,第二段视频提供运镜。这样将视觉身份与动作分开,而不是要求同一段提示词凭空创造两者。
MiniMax H3 镜头参考工作流
视频也可以定义镜头,而不是演员。产品图像可以保留几何结构,另一段无关视频则提供缓慢环绕、推进、手持跟拍或类似摇臂的运动。
从设计角度看,这很重要,因为镜头语言是创意方向的一部分。相同产品可以因镜头运动方式不同而呈现高端感、活力感或纪实感。
为什么“仅动作”仍可能串入外观
“仅用此视频参考动作”是一条指令,并不是完美的信息提取边界。服装、体型、光照或其他视觉特征仍可能从源视频串入。
出现这种情况时,最好的初步修复通常是简化参考素材集合、强化预期的身份来源,并缩小视频的职责范围。
MiniMax H3 音频参考如何工作?
H3 可以联合生成音频与视频,让声音成为创意系统的一部分,而不只是后期制作的一层。
音频参考可以影响音色、表达方式、音乐、节奏、配乐结构、音效与声音质感。
MiniMax H3 音频复用与音频参考对比
音频复用指保留现有信号的全部或一部分。音频参考则是借用特征,同时允许生成内容发生变化。
对于新对白,这个区别很重要。如果源素材应该定义说话者而不是台词,创意方向应强调音色与表达方式,而非简单复用原始音频。
MiniMax H3 音频常见失败类型
我们审阅记录在案的 H3 工作流后,发现反复出现的问题包括:
- 音节重复
- 语音失真
- 近似胡言乱语的对白
- 角色之间串音
- 唇形同步较弱
- 音频早于画面片段结束
一个记录在案的 20 步 Spectrum 工作流进行了 11 次真实 Transformer 计算,并预测了 9 个中间步骤,将采样器工作量降低约45%。同一工作流也产生了更粗糙的音频和重复音节。
这带来一个重要的制作启示:能保留可接受画面的优化,仍然可能损害对白。
MiniMax H3 FL2VA 与 Ref2VA:该选哪个?
FL2VA 与 Ref2VA 解决不同的控制问题。
需求 | 更合适的选择 |
|---|---|
精确控制首帧 | FL2VA |
精确控制尾帧 | FL2VA |
角色加动作 | Ref2VA |
角色加镜头 | Ref2VA |
多图像参考 | Ref2VA |
音频参考 | Ref2VA |
复杂多模态组合 | Ref2VA |
画面本身是首要约束时,使用 FL2VA。不同属性必须来自不同参考素材时,使用 Ref2VA。
何时 FL2VA 更合适
如果已有设计好的关键视觉、分镜画面或规定的结束状态,FL2VA 往往是更简洁的选择。如果多参考控制并未带来真正的创意价值,Ref2VA 可能只会增加不必要的复杂度。
何时 Ref2VA 更合适
当镜头要组合不同来源的身份、服装、动作、镜头与声音时,Ref2VA 更有优势。
在我们研究的多个工作流中,清晰度下降、颗粒增加以及感知细节减少是反复出现的 Ref2VA 问题。这些观察并不是同种子的受控基准测试,但揭示了一个有用的取舍:更深入的参考控制可能以感知图像保真度为代价。
如何组合多份 MiniMax H3 参考素材而不产生冲突?
可靠的多参考工作流从三个问题开始:
哪些必须保持不变?哪些应该迁移?哪些必须忽略?
对于角色视频:
- 保留:面部、发型、服装
- 迁移:编舞、镜头路径、声音特征
- 忽略:源表演者身份、不需要的服装、无关背景细节
对于产品广告:
创意变量 | 来源 |
|---|---|
产品几何结构 | 产品图像 |
演员 | 角色图像 |
环境 | 地点图像 |
镜头 | 视频参考 |
人声或提示音 | 音频参考 |
时序 | 提示词 |
渲染前,检查是否有两份参考素材对同一属性给出了不同定义。删除一份冲突参考,往往比增加更多提示词文字更能改善控制。
如何编写更好的 MiniMax H3 参考提示词?
好的 H3 提示词读起来像一份简明的制作需求简报。
定义参考职责与保留内容
先说明每个来源控制什么,再锁定不能改变的细节:面部、发型、服装、产品形状、标志、颜色或材质。
按时间线编写场景
视频提示词应描述动作何时发生。一个 15 秒镜头可以先交代场景,再引入表演,随后加入镜头环绕,并以对白结束。
这为 H3 提供时间结构,也为创意团队提供明确的审阅检查点。
分开编写镜头、声音与负面约束
镜头指令应描述如何拍摄场景:环绕、推进、手持运动、转移焦点或浅景深。
声音指令应单独定义说话者、声音参考、环境声、音乐与时序。负面约束应聚焦影响制作的关键失败,如标志发生变化、继承错误演员或出现第二个声音。
目标不是让提示词更长,而是减少模糊不清的决定。
哪些 MiniMax H3 性能数据具有实际意义?
我们的审阅涵盖多个本地工作流。它们并不是标准化基准,但能表明迭代成本会以多快的速度上升。
硬件/工作流 | 报告结果 |
|---|---|
RTX 4070 Ti SUPER 16GB | 640×832:1.63 秒视频用时 2 分 09 秒;736×960:6.58 秒视频用时 6 分 55 秒 |
RTX 6000 PRO 96GB | 1K:基线 14 秒,EasyCache 8 秒;2K:基线 37 秒,EasyCache 22 秒 |
RTX 5090 长片工作流 | 约 1.5 MP 的 15 秒片段,耗时约 10 分钟 |
768×1280,20 步 | 5 秒:2 分钟;10 秒:6 分钟;20 秒:20 分钟;30 秒:43 分钟 |
最重要的实际启示是,生成时长增加时,成本可能以更快的比例攀升。先以低成本出草稿,验证参考素材、动作、构图与种子,再投入最终质量的生成。

MiniMax H3 可以生成静态图像吗?
H3 也被用于实验性的静态图像工作流,包括海报、角色设定表、服装编辑、地点变更与镜头角度调整。一个记录在案的 RTX 5090 RunPod 工作流报告称,编辑一张 1920×1088 图像约需 8 秒。
这更适合被理解为一种工作流变通方案,而非官方原生图像模式。
如何让更长的 MiniMax H3 视频保持一致?
由于原生输出时长为 4–15 秒,更长的制作通常需要按片段续接。
一个记录在案的工作流会将之前约22 帧传入下一次生成。另一个工作流在拼接一个约两分钟的项目时,会复用每段最后的2–3 秒。
实用的长片工作流如下:
- 生成短片段。
- 选择成功的版本。
- 保留结束时的视觉状态。
- 复用身份与服装参考。
- 生成下一片段。
- 拼接成功片段。
- 分别检查人声、环境声与音乐的连续性。
角色设定表也有帮助,可以通过多个视角定义正面、侧面、身体、发型、服装和配饰。
MiniMax H3 参考素材最佳实践
为了稳定制作,将这些原则放在同一份检查清单中:
- 为每份参考素材指定一项主要职责。
- 将身份与表演分开。
- 增加提示词复杂度前,先删除冲突参考。
- 明确写出时间与场景节拍。
- 锁定关键的品牌、产品与身份属性。
- 将音频与视觉质量分开评估。
- 低成本出草稿,再把算力花在值得完成的版本上。
将这些原则纳入记录清晰的MiniMax H3 工作流,比每次生成都重新摸索,更容易重复执行。
常见问题
为什么 Ref2VA 比 FL2VA 模糊?
我们的审阅发现,一些 Ref2VA 工作流反复被报告存在细节偏软、颗粒增加和感知清晰度降低。这不是通用的受控基准。如果只需要强有力的首帧或尾帧控制,FL2VA 可能更简单;当多参考灵活性不可或缺时,再使用 Ref2VA。
应该使用 FL2VA 还是 Ref2VA?
当开始或结束画面是主要约束时,使用 FL2VA。当需要组合不同来源的身份、服装、动作、镜头或音频时,使用 Ref2VA。更好的模式,是引入最少不必要控制复杂度的那一种。
H3 能制作超过 15 秒的视频吗?
可以,但更长的项目通常由多个短生成片段拼接而成。实用工作流会复用结束帧、前段视频的若干秒、角色参考及一致的音频方向,以减少片段之间的不连续。
H3 能生成静态图像吗?
H3 可以通过实验性工作流生成和编辑静态图像,但这不等于官方原生图像模式。记录在案的用途包括海报、角色设定表、服装编辑和镜头角度变更。
结论
当把图像、视频和音频参考视为各自承担创意职责的独立来源,而非一堆上下文信息时,MiniMax H3 最能发挥力量。图像通常应定义稳定的视觉身份,视频应定义时间行为,音频应定义声音特征,提示词则应解释这些来源如何交互。Ref2VA 支持更深入的多模态控制,但这种灵活性也可能带来清晰度、音频可靠性、一致性与算力成本的取舍。因此,最有效的制作策略是为每份参考素材指定明确职责,将身份与表演分离,锁定关键属性,按时间组织场景,独立验证音频,并在最终渲染前低成本迭代。对于正在判断这种重参考方式最适用场景的团队,MiniMax H3 的适用场景提供了实用的下一步指引。
更多 Virse 博客文章
工作流

GPT Image 2.5 Noise and Oversharpening: Why Some Images Still Look AI-Generated
2026年10月9日 by Yifan Zhao
工作流

GPT Image 2.5 Keeps Changing My Image: How to Use a "Keep List" for Reliable Edits
2026年10月9日 by Yifan Zhao
工作流

GPT Image 2.5 Editing Drift: Why Images Get Blurry, Cropped or Worse After Multiple Edits
2026年10月9日 by Yifan Zhao