MiniMax H3 参考指南:图像、视频与音频详解

Yifan ZhaoYifan Zhao9 分钟阅读 ·

MiniMax H3 参考指南:图像、视频与音频详解

MiniMax H3 参考素材让创作者通过不同来源素材控制视频的外观、运动方式与声音。图像最适合身份、服装、产品与环境;视频适合动作、表演、镜头行为与节奏;音频适合音色、音乐、节拍与声音特征。这些控制在MiniMax H3 动作迁移中尤其重要,因为不同参考素材可以分别负责身份、动作、镜头和声音。

难点在于避免这些参考素材相互竞争。动作视频可能串入外观信息,多张图像可能争夺身份定义权,而 Ref2VA 可能用视觉清晰度换取更灵活的参考控制。实际中,应在生成前明确每份参考素材应保留、迁移和忽略哪些内容,才能获得更好的结果。结构清晰的MiniMax H3 提示词与可重复执行的MiniMax H3 工作流让这些职责更容易控制。

对于希望扩大这些工作流规模的团队,Virse将参考素材、资产与多个 AI Agent整合到同一个无限画布中,共享创意上下文与长期视觉记忆。Virse 让创作者在一个画布上使用 Nano Banana 2、GPT Image 2、Seedance 2.0 等 50 多个模型,帮助把参考驱动的生成扩展为更全面的AI 设计工作流。新用户可以通过免费积分开始使用,付费套餐则为更大规模的制作工作流解锁高级模型,以及指定快速模型的无限使用权限。

Virse 创作工作界面

什么是 MiniMax H3 参考素材,它们如何工作?

MiniMax H3 参考素材是用于向新生成内容提供特定属性的图像、视频或音频资产。使用 H3 最可靠的思路是关注参考素材的职责,而非文件类型。

参考素材

最适合

典型作用

图像

稳定的外观

身份、服装、产品、环境

画面锚点

特定视觉状态

构图、取景、开始或结束状态

视频

随时间变化的行为

动作、表演、镜头、节奏

音频

声音特征

人声、音乐、节奏、音质纹理

简单的制作分工可以是:图像 1 负责身份、图像 2 负责服装、视频 1 负责编舞、视频 2 负责运镜、音频 1 负责音色。这种“一份参考素材、一项主要职责”的方法不是技术限制,而是减少歧义的实用做法。

MiniMax H3 参考素材限制

规划工作流时,H3 官方规格同样重要。

输入或输出

限制

参考图像

最多 9 张

参考视频

最多 3 段,每段 2–15 秒,总计 15 秒

参考音频

最多 3 段,每段 2–15 秒,总计 15 秒

混合参考文件

最多 12 份

仅音频 Ref2VA 输入

不支持

输出时长

4–15 秒

输出帧率

24 FPS

原生音频

32 kHz 立体声

实际含义很简单:可使用的参考素材数量,超过了大多数项目真正应该使用的数量。从能清楚定义镜头的最小素材集合开始。

MiniMax H3 参考能力概览

MiniMax H3 图像参考如何控制身份与外观?

MiniMax H3 图像参考最适合控制在各帧中应保持视觉可辨识性的属性,包括面部、发型、服装、产品几何结构、材质、环境与视觉风格。

MiniMax H3 主体参考与画面锚点对比

主体参考代表可重复使用的人物或物体。画面式锚点则更接近一个具体构图或视觉状态。

当需求是“保留这个角色或产品”时,使用面向主体的参考。当需求是“从这张特定图像开始或结束”时,使用面向画面的工作流。

角色与产品一致性

对于角色,一份干净明确的身份参考通常比多张相互不一致的人像更有用。发型、年龄、服装或比例相互冲突,会削弱身份保留效果。

产品需要更严格的约束。即使镜头很有电影感,只要标志位置移动或轮廓改变,就仍然无法使用。品牌项目应明确保留比例、标志位置、材质、颜色与独特结构细节。

MiniMax H3 视频参考如何控制动作与镜头?

视频参考最适合随时间展开的信息:身体动作、编舞、表演、手势节奏、镜头路径、节拍、切镜与剪辑节奏。

MiniMax H3 身份迁移与表演迁移对比

Ref2VA 最有效的模式之一是:

图像 A 定义角色是谁。视频 B 定义角色做什么。

例如,时尚工作流可以用一张图像定义身份,另一张定义服装,一段视频提供走路表演,第二段视频提供运镜。这样将视觉身份与动作分开,而不是要求同一段提示词凭空创造两者。

MiniMax H3 镜头参考工作流

视频也可以定义镜头,而不是演员。产品图像可以保留几何结构,另一段无关视频则提供缓慢环绕、推进、手持跟拍或类似摇臂的运动。

从设计角度看,这很重要,因为镜头语言是创意方向的一部分。相同产品可以因镜头运动方式不同而呈现高端感、活力感或纪实感。

为什么“仅动作”仍可能串入外观

“仅用此视频参考动作”是一条指令,并不是完美的信息提取边界。服装、体型、光照或其他视觉特征仍可能从源视频串入。

出现这种情况时,最好的初步修复通常是简化参考素材集合、强化预期的身份来源,并缩小视频的职责范围。

MiniMax H3 音频参考如何工作?

H3 可以联合生成音频与视频,让声音成为创意系统的一部分,而不只是后期制作的一层。

音频参考可以影响音色、表达方式、音乐、节奏、配乐结构、音效与声音质感。

MiniMax H3 音频复用与音频参考对比

音频复用指保留现有信号的全部或一部分。音频参考则是借用特征,同时允许生成内容发生变化。

对于新对白,这个区别很重要。如果源素材应该定义说话者而不是台词,创意方向应强调音色与表达方式,而非简单复用原始音频。

MiniMax H3 音频常见失败类型

我们审阅记录在案的 H3 工作流后,发现反复出现的问题包括:

  • 音节重复
  • 语音失真
  • 近似胡言乱语的对白
  • 角色之间串音
  • 唇形同步较弱
  • 音频早于画面片段结束

一个记录在案的 20 步 Spectrum 工作流进行了 11 次真实 Transformer 计算,并预测了 9 个中间步骤,将采样器工作量降低约45%。同一工作流也产生了更粗糙的音频和重复音节。

这带来一个重要的制作启示:能保留可接受画面的优化,仍然可能损害对白。

MiniMax H3 FL2VA 与 Ref2VA:该选哪个?

FL2VA 与 Ref2VA 解决不同的控制问题。

需求

更合适的选择

精确控制首帧

FL2VA

精确控制尾帧

FL2VA

角色加动作

Ref2VA

角色加镜头

Ref2VA

多图像参考

Ref2VA

音频参考

Ref2VA

复杂多模态组合

Ref2VA

画面本身是首要约束时,使用 FL2VA。不同属性必须来自不同参考素材时,使用 Ref2VA。

何时 FL2VA 更合适

如果已有设计好的关键视觉、分镜画面或规定的结束状态,FL2VA 往往是更简洁的选择。如果多参考控制并未带来真正的创意价值,Ref2VA 可能只会增加不必要的复杂度。

何时 Ref2VA 更合适

当镜头要组合不同来源的身份、服装、动作、镜头与声音时,Ref2VA 更有优势。

在我们研究的多个工作流中,清晰度下降、颗粒增加以及感知细节减少是反复出现的 Ref2VA 问题。这些观察并不是同种子的受控基准测试,但揭示了一个有用的取舍:更深入的参考控制可能以感知图像保真度为代价。

如何组合多份 MiniMax H3 参考素材而不产生冲突?

可靠的多参考工作流从三个问题开始:

哪些必须保持不变?哪些应该迁移?哪些必须忽略?

对于角色视频:

  • 保留:面部、发型、服装
  • 迁移:编舞、镜头路径、声音特征
  • 忽略:源表演者身份、不需要的服装、无关背景细节

对于产品广告:

创意变量

来源

产品几何结构

产品图像

演员

角色图像

环境

地点图像

镜头

视频参考

人声或提示音

音频参考

时序

提示词

渲染前,检查是否有两份参考素材对同一属性给出了不同定义。删除一份冲突参考,往往比增加更多提示词文字更能改善控制。

如何编写更好的 MiniMax H3 参考提示词?

好的 H3 提示词读起来像一份简明的制作需求简报。

定义参考职责与保留内容

先说明每个来源控制什么,再锁定不能改变的细节:面部、发型、服装、产品形状、标志、颜色或材质。

按时间线编写场景

视频提示词应描述动作何时发生。一个 15 秒镜头可以先交代场景,再引入表演,随后加入镜头环绕,并以对白结束。

这为 H3 提供时间结构,也为创意团队提供明确的审阅检查点。

分开编写镜头、声音与负面约束

镜头指令应描述如何拍摄场景:环绕、推进、手持运动、转移焦点或浅景深。

声音指令应单独定义说话者、声音参考、环境声、音乐与时序。负面约束应聚焦影响制作的关键失败,如标志发生变化、继承错误演员或出现第二个声音。

目标不是让提示词更长,而是减少模糊不清的决定。

哪些 MiniMax H3 性能数据具有实际意义?

我们的审阅涵盖多个本地工作流。它们并不是标准化基准,但能表明迭代成本会以多快的速度上升。

硬件/工作流

报告结果

RTX 4070 Ti SUPER 16GB

640×832:1.63 秒视频用时 2 分 09 秒;736×960:6.58 秒视频用时 6 分 55 秒

RTX 6000 PRO 96GB

1K:基线 14 秒,EasyCache 8 秒;2K:基线 37 秒,EasyCache 22 秒

RTX 5090 长片工作流

约 1.5 MP 的 15 秒片段,耗时约 10 分钟

768×1280,20 步

5 秒:2 分钟;10 秒:6 分钟;20 秒:20 分钟;30 秒:43 分钟

最重要的实际启示是,生成时长增加时,成本可能以更快的比例攀升。先以低成本出草稿,验证参考素材、动作、构图与种子,再投入最终质量的生成。

H3 渲染时间随视频时长快速增加

MiniMax H3 可以生成静态图像吗?

H3 也被用于实验性的静态图像工作流,包括海报、角色设定表、服装编辑、地点变更与镜头角度调整。一个记录在案的 RTX 5090 RunPod 工作流报告称,编辑一张 1920×1088 图像约需 8 秒。

这更适合被理解为一种工作流变通方案,而非官方原生图像模式。

如何让更长的 MiniMax H3 视频保持一致?

由于原生输出时长为 4–15 秒,更长的制作通常需要按片段续接。

一个记录在案的工作流会将之前约22 帧传入下一次生成。另一个工作流在拼接一个约两分钟的项目时,会复用每段最后的2–3 秒。

实用的长片工作流如下:

  1. 生成短片段。
  2. 选择成功的版本。
  3. 保留结束时的视觉状态。
  4. 复用身份与服装参考。
  5. 生成下一片段。
  6. 拼接成功片段。
  7. 分别检查人声、环境声与音乐的连续性。

角色设定表也有帮助,可以通过多个视角定义正面、侧面、身体、发型、服装和配饰。

MiniMax H3 参考素材最佳实践

为了稳定制作,将这些原则放在同一份检查清单中:

  1. 为每份参考素材指定一项主要职责。
  2. 将身份与表演分开。
  3. 增加提示词复杂度前,先删除冲突参考。
  4. 明确写出时间与场景节拍。
  5. 锁定关键的品牌、产品与身份属性。
  6. 将音频与视觉质量分开评估。
  7. 低成本出草稿,再把算力花在值得完成的版本上。

将这些原则纳入记录清晰的MiniMax H3 工作流,比每次生成都重新摸索,更容易重复执行。

常见问题

为什么 Ref2VA 比 FL2VA 模糊?

我们的审阅发现,一些 Ref2VA 工作流反复被报告存在细节偏软、颗粒增加和感知清晰度降低。这不是通用的受控基准。如果只需要强有力的首帧或尾帧控制,FL2VA 可能更简单;当多参考灵活性不可或缺时,再使用 Ref2VA。

应该使用 FL2VA 还是 Ref2VA?

当开始或结束画面是主要约束时,使用 FL2VA。当需要组合不同来源的身份、服装、动作、镜头或音频时,使用 Ref2VA。更好的模式,是引入最少不必要控制复杂度的那一种。

H3 能制作超过 15 秒的视频吗?

可以,但更长的项目通常由多个短生成片段拼接而成。实用工作流会复用结束帧、前段视频的若干秒、角色参考及一致的音频方向,以减少片段之间的不连续。

H3 能生成静态图像吗?

H3 可以通过实验性工作流生成和编辑静态图像,但这不等于官方原生图像模式。记录在案的用途包括海报、角色设定表、服装编辑和镜头角度变更。

结论

当把图像、视频和音频参考视为各自承担创意职责的独立来源,而非一堆上下文信息时,MiniMax H3 最能发挥力量。图像通常应定义稳定的视觉身份,视频应定义时间行为,音频应定义声音特征,提示词则应解释这些来源如何交互。Ref2VA 支持更深入的多模态控制,但这种灵活性也可能带来清晰度、音频可靠性、一致性与算力成本的取舍。因此,最有效的制作策略是为每份参考素材指定明确职责,将身份与表演分离,锁定关键属性,按时间组织场景,独立验证音频,并在最终渲染前低成本迭代。对于正在判断这种重参考方式最适用场景的团队,MiniMax H3 的适用场景提供了实用的下一步指引。

更多 Virse 博客文章