MiniMax H3 使用全指南:ComfyUI、提示词、参考素材、音频与性能
Yifan Zhao8 分钟阅读 ·

要想高效使用 MiniMax H3,文本驱动生成时选 T2V,已有图片需要确定场景基础时选 I2V;需要更精确地控制身份、动作、运镜、风格或声音时选 R2V。在 ComfyUI 中先做低分辨率短片测试,调整提示词和参考素材,确认镜头效果后再提高质量,也更便于管理结构化的MiniMax H3 工作流。若想全面了解模型的实际优势与局限,MiniMax H3 评测提供了更多背景。
难点并非让 H3 生成视频,而是获得可重复、可用于生产的结果。选错模型权重可能削弱参考效果,含糊的提示词可能让错误的角色说台词,高分辨率测试则会增加每次失败的代价。清晰的MiniMax H3 提示词有助于减少歧义,而严谨的H3 生产工作流会把创意、身份、动作、镜头、音频和最终质量拆分为可独立测试的决策。
Virse让更完整的创作过程更易管理。设计师无需将 AI 工作局限于孤立的聊天,而可在无限画布上整理参考素材、资产与决策,让多个 Agent 共享项目上下文开展工作。产品设计还注重学习团队偏好、品牌规范及既有创作背景,帮助 AI 生成融入一致的AI 设计工作流,避免成为又一个割裂的工具;AI 设计智能体也能支持更协调的创作流程。

如何在 ComfyUI 中使用 MiniMax H3
MiniMax H3 是一种全模态视频生成系统,可理解文本、图片、视频与音频,并联合生成视频和立体声音频。ComfyUI 提供原生开放权重 T2V、I2V 和 R2V 工作流,其当前文档要求使用ComfyUI 0.30.0 或更新版本,因此官方模板库是最便捷的起点。若是首次配置模型,这篇MiniMax H3 使用指南介绍了更完整的流程。
首次生成可按以下流程操作:
- 更新 ComfyUI。
- 打开 Template Library(模板库)→ Video(视频)→ MiniMax H3。
- 选择 T2V、I2V 或 R2V。
- 加载正确的扩散模型及配套编码器、VAE。
- 生成一段短预览。
- 检查身份、动作、运镜方向、对白与音频。
- 每次只调整一个主要变量。
- 镜头效果稳定后再提高分辨率。
需要哪些 MiniMax H3 模型?
T2V、I2V 和首尾帧生成使用FL2VA,参考驱动的 R2V 则使用Ref2VA。两种工作流都需要 Qwen3-VL 文本编码器以及 H3 视频和音频 VAE。ComfyUI 文档明确区分了这些权重,因此参考素材似乎不起作用时,应先检查所加载的扩散模型。
MiniMax H3:T2V、I2V 与 R2V 对比
工作流 | 适用场景 | 主要控制来源 |
|---|---|---|
T2V | 创意探索与新场景 | 文本 |
I2V | 让现有构图动起来 | 首张图片 |
首尾帧 | 预先规划的转场 | 起始帧与结束帧 |
R2V | 身份、动作、运镜、风格或声音一致性 | 多模态参考素材 |
选择原则是:重探索选 T2V,重构图选 I2V,重一致性选 R2V。将 R2V 简单视为更强的 I2V 是常见误区,因为两者使用不同的模型权重,R2V 也需要更明确的参考策略。
如何写出更好的 MiniMax H3 提示词
好的 MiniMax H3 提示词更像一份视听制作简报,而非图片生成提示词。MiniMax 官方指南围绕多模态镜头描述、整体声景及非叙事内音乐组织生成,因此视觉指导与音频应一同规划。需要更系统地组织这些指令时,可参考MiniMax H3 提示词指南。
按镜头编写 MiniMax H3 提示词
先确定场景与初始构图,再描述随时间发生的可观察动作与运镜。针对多镜头视频,MiniMax 指南中的 Shot 1 不带时间戳,后续镜头则注明切换时刻;时间区间适合用来规划分镜,但并非文档规定的最终格式。
可按以下顺序规划:
参考素材职责 → 镜头 → 主体 → 动作 → 运镜 → 对白 → 音效 → 声景 → 音乐
不要只要求“电影感产品亮相”,而应明确具体变化:镜头缓慢推向产品,主体将产品转向光源,传来机械咔嗒声,随后切换到细节特写。
控制 MiniMax H3 的对白与音频
H3 会随视频一同生成对白、环境声、音效和音乐。MiniMax 建议跨镜头保持说话者身份稳定,当场景中出现两个或更多角色时尤其重要。
我们对真实用户问题的整理发现,台词归属错误和意外唇动经常出现。应紧密关联每位说话者的身份、动作与台词。使用旁白时,要明确其为画外音,并说明画面中的角色不应说话。
如何用 MiniMax H3 R2V 参考素材提高一致性
MiniMax H3 R2V 最多支持9 张参考图片、3 段参考视频和 3 段参考音频,整个参考集合合计最多 12 个文件。MiniMax 模型文档确认了这些限制,但通常无需把数量用满。

更实用的原则是:让每个参考素材承担一项主要职责。
例如:
- 图片 1 控制角色身份。
- 图片 2 控制环境或视觉风格。
- 视频 1 控制动作与运镜。
- 音频 1 控制声音。
MiniMax 的完整参考指南区分了主体、图片锚点、视频结构和音频信号,进一步说明参考素材之间的关系应明确表达,而非留给模型推断。

MiniMax H3 ref_image_size:match 与 max
ComfyUI 提供两种实用的参考图片策略。match 优先考虑速度,会将参考图片缩放至接近生成分辨率;max 则最多保留短边 2048 像素,以提高身份还原度,但处理成本也更高。
对于人脸、产品或精细的角色资产,max 带来的效果可能值得更慢的迭代。对于环境或整体风格参考,match 通常是更高效的起点。
MiniMax H3 分辨率:本地 768p 与 2K 输出
“MiniMax H3 支持 2K”需要结合上下文理解。
本地 MiniMax H3 生成什么分辨率?
开放的 H3-Base 工作流输出768p 级别的视频。ComfyUI 建议使用 768 像素短边,完整质量的本地画布可采用约1344×768、16:9 比例;预览迭代则更适合较低的百万像素设置。
MiniMax H3 如何生成 2K?
MiniMax 官方模型卡说明,完整的 H3 系统包含H3-Context-IR、H3-Base 和 H3-Regenerate-2K。H3-Base 先生成 768p 结果,H3-Regenerate-2K 再结合该结果与原始多模态上下文重新生成更高分辨率的细节,而非采用传统超分辨率处理。

Context-IR 和 Regenerate-2K 目前是托管组件,并不属于开放权重版本。MiniMax API 工作流支持最高 2K、每段 5–15 秒,因此本地 768p 生成与托管 2K 输出不应视为相同的工作流。

MiniMax H3 需要多少显存?
很难给出有实际意义的单一最低显存数字,因为性能取决于显存、系统内存、分辨率、时长、步数、量化、卸载策略和注意力实现。
在我们整理的本地工作流记录中,一台 RTX 4090 Laptop 配置使用16GB 显存和 32GB 内存,配合 20 步与 Sage Attention,用 182 秒生成了带音频的 5 秒 960×540 视频。这是有参考价值的实际案例,但不是受控基准测试。
研究资料还包含一些低显存报告,其中通过大量卸载让 H3 得以运行。这里应区分:GPU 能完成生成,并不代表速度足以支持流畅的创意迭代。

如何用 Sage Attention 加速 MiniMax H3
若要提高 H3 生成速度,先降低时长与分辨率。两者直接减少模型需要生成的视频量,让提示词测试成本显著降低。
在此基础上,Sage Attention 是文档中最明确的优化方式。ComfyUI 表示它可在质量损失很小的情况下,让 H3 生成速度提高约一倍,但具体提升幅度随配置而异。
专业工作流仍应对加速设置做 A/B 测试。使用相同提示词和随机种子,检查人脸、远处主体、产品细节、动作连贯性与音画同步,再决定是否采用较激进的加速方法。
MiniMax H3 常见问题与修复方法
问题 | 优先尝试的修复方法 |
|---|---|
R2V 忽略参考素材 | 确认加载 Ref2VA,并为每个参考素材指定明确职责 |
错误的角色说台词 | 保持说话者身份稳定,并将台词与该角色动作紧密关联 |
旁白时角色嘴唇在动 | 明确指定画外旁白,并说明可见主体不说话 |
身份发生变化 | 减少相互冲突的参考素材,或提高参考图片细节 |
生成太慢 | 缩短时长、降低预览分辨率、启用 Sage Attention |
缺少 H3 节点 | 更新 ComfyUI 并重新加载官方 H3 模板 |
这套排查结构反映了我们整理 H3 用户问题时发现的高频问题。实际操作中,简化工作流往往比增加提示词指令更有效。
怎样的 MiniMax H3 工作流更适合生产?
对于专业视频与设计工作,我建议采用以镜头为单位的迭代流程:
预览 → 提示词 A/B → 参考素材 A/B → 选定版本 → 原生质量渲染 → 按需进行 2K 或后期处理 → 剪辑
这种方式让 H3 成为可控的创作系统。T2V 探索创意,I2V 固定设计好的构图,R2V 保持关键视觉或音频参考,而短预览能在高成本的最终生成前暴露问题。专门的MiniMax H3 生产工作流有助于规范这一顺序。
从产品设计角度看,相比让一条提示词同时解决创意、身份、镜头、动作、对白和后期问题,这种方式更容易扩展。目标不是减少决策,而是让每项决策成本更低、更易评估。这也凸显了了解MiniMax H3 适用场景的重要性,因为并非所有创作任务都需要同等程度的多模态控制。
常见问题
12GB 显存能运行 H3 吗?
通过量化模型与卸载,H3 可在资源有限的消费级硬件上运行,但仅凭显存无法预测生成速度。分辨率、时长、系统内存、模型变体、步数和注意力优化都会影响表现。更实用的硬件测试,是在计划实际使用的设置下,测量目标 5 秒预览的生成时间。
为什么 H3 R2V 参考素材不起作用?
先确认使用的是Ref2VA 而非 FL2VA。再为每张图片、每段视频或音频指定具体职责,如身份、环境、动作、运镜或声音。如果多个参考素材争夺同一属性的控制权,应先减少素材,再考虑增加提示词复杂度。
H3 提示词应使用 Shot 1 还是时间区间?
如果时间区间有助于规划分镜,可以用来做前期规划;但 MiniMax 官方基础提示词指南按顺序镜头组织最终提示词,后续镜头需注明切换时刻。这个区别很重要,因为有效的创意规划技巧未必就是模型文档规定的提示词结构。
本地 H3 能生成原生 2K 吗?
仅靠 H3-Base 不行。开放的 H3-Base 工作流输出 768p 级别视频。MiniMax 完整系统使用 H3-Regenerate-2K,结合原始上下文重新生成基础结果;官方 API 则可提供最高 2K 输出。
结语
MiniMax H3 更适合作为结构化的视听制作工作流,而非一条提示词生成视频的捷径。根据创作约束选择 T2V、I2V 或 R2V,正确使用 FL2VA 或 Ref2VA,为每个参考素材分配明确职责,描述可观察的镜头与运镜,并同步指导音频;先用低成本预览验证想法,再提高分辨率。实际最重要的问题,不只是硬件能否运行 H3,而是配置能否支持足够快的迭代,帮助你做出好的创作决策。待MiniMax H3 工作流稳定后,本地 768p 生成、托管 2K 后期处理与Virse便可融入更易扩展的专业AI 驱动设计流程。
更多 Virse 博客文章
工作流

GPT Image 2.5 Noise and Oversharpening: Why Some Images Still Look AI-Generated
2026年10月9日 by Yifan Zhao
工作流

GPT Image 2.5 Keeps Changing My Image: How to Use a "Keep List" for Reliable Edits
2026年10月9日 by Yifan Zhao
工作流

GPT Image 2.5 Editing Drift: Why Images Get Blurry, Cropped or Worse After Multiple Edits
2026年10月9日 by Yifan Zhao