MiniMax H3 使用全指南:ComfyUI、提示词、参考素材、音频与性能

Yifan ZhaoYifan Zhao8 分钟阅读 ·

MiniMax H3 使用全指南:ComfyUI、提示词、参考素材、音频与性能

要想高效使用 MiniMax H3,文本驱动生成时选 T2V,已有图片需要确定场景基础时选 I2V;需要更精确地控制身份、动作、运镜、风格或声音时选 R2V。在 ComfyUI 中先做低分辨率短片测试,调整提示词和参考素材,确认镜头效果后再提高质量,也更便于管理结构化的MiniMax H3 工作流。若想全面了解模型的实际优势与局限,MiniMax H3 评测提供了更多背景。

难点并非让 H3 生成视频,而是获得可重复、可用于生产的结果。选错模型权重可能削弱参考效果,含糊的提示词可能让错误的角色说台词,高分辨率测试则会增加每次失败的代价。清晰的MiniMax H3 提示词有助于减少歧义,而严谨的H3 生产工作流会把创意、身份、动作、镜头、音频和最终质量拆分为可独立测试的决策。

Virse让更完整的创作过程更易管理。设计师无需将 AI 工作局限于孤立的聊天,而可在无限画布上整理参考素材、资产与决策,让多个 Agent 共享项目上下文开展工作。产品设计还注重学习团队偏好、品牌规范及既有创作背景,帮助 AI 生成融入一致的AI 设计工作流,避免成为又一个割裂的工具;AI 设计智能体也能支持更协调的创作流程。

Virse 创作素材浏览界面截图

如何在 ComfyUI 中使用 MiniMax H3

MiniMax H3 是一种全模态视频生成系统,可理解文本、图片、视频与音频,并联合生成视频和立体声音频。ComfyUI 提供原生开放权重 T2V、I2V 和 R2V 工作流,其当前文档要求使用ComfyUI 0.30.0 或更新版本,因此官方模板库是最便捷的起点。若是首次配置模型,这篇MiniMax H3 使用指南介绍了更完整的流程。

首次生成可按以下流程操作:

  1. 更新 ComfyUI。
  2. 打开 Template Library(模板库)→ Video(视频)→ MiniMax H3。
  3. 选择 T2V、I2V 或 R2V。
  4. 加载正确的扩散模型及配套编码器、VAE。
  5. 生成一段短预览。
  6. 检查身份、动作、运镜方向、对白与音频。
  7. 每次只调整一个主要变量。
  8. 镜头效果稳定后再提高分辨率。

需要哪些 MiniMax H3 模型?

T2V、I2V 和首尾帧生成使用FL2VA,参考驱动的 R2V 则使用Ref2VA。两种工作流都需要 Qwen3-VL 文本编码器以及 H3 视频和音频 VAE。ComfyUI 文档明确区分了这些权重,因此参考素材似乎不起作用时,应先检查所加载的扩散模型。

MiniMax H3:T2V、I2V 与 R2V 对比

工作流

适用场景

主要控制来源

T2V

创意探索与新场景

文本

I2V

让现有构图动起来

首张图片

首尾帧

预先规划的转场

起始帧与结束帧

R2V

身份、动作、运镜、风格或声音一致性

多模态参考素材

选择原则是:重探索选 T2V,重构图选 I2V,重一致性选 R2V。将 R2V 简单视为更强的 I2V 是常见误区,因为两者使用不同的模型权重,R2V 也需要更明确的参考策略。

如何写出更好的 MiniMax H3 提示词

好的 MiniMax H3 提示词更像一份视听制作简报,而非图片生成提示词。MiniMax 官方指南围绕多模态镜头描述、整体声景及非叙事内音乐组织生成,因此视觉指导与音频应一同规划。需要更系统地组织这些指令时,可参考MiniMax H3 提示词指南。

按镜头编写 MiniMax H3 提示词

先确定场景与初始构图,再描述随时间发生的可观察动作与运镜。针对多镜头视频,MiniMax 指南中的 Shot 1 不带时间戳,后续镜头则注明切换时刻;时间区间适合用来规划分镜,但并非文档规定的最终格式。

可按以下顺序规划:

参考素材职责 → 镜头 → 主体 → 动作 → 运镜 → 对白 → 音效 → 声景 → 音乐

不要只要求“电影感产品亮相”,而应明确具体变化:镜头缓慢推向产品,主体将产品转向光源,传来机械咔嗒声,随后切换到细节特写。

控制 MiniMax H3 的对白与音频

H3 会随视频一同生成对白、环境声、音效和音乐。MiniMax 建议跨镜头保持说话者身份稳定,当场景中出现两个或更多角色时尤其重要。

我们对真实用户问题的整理发现,台词归属错误和意外唇动经常出现。应紧密关联每位说话者的身份、动作与台词。使用旁白时,要明确其为画外音,并说明画面中的角色不应说话。

如何用 MiniMax H3 R2V 参考素材提高一致性

MiniMax H3 R2V 最多支持9 张参考图片、3 段参考视频和 3 段参考音频,整个参考集合合计最多 12 个文件。MiniMax 模型文档确认了这些限制,但通常无需把数量用满。

MiniMax H3 R2V 参考素材数量限制


更实用的原则是:让每个参考素材承担一项主要职责。

例如:

  • 图片 1 控制角色身份。
  • 图片 2 控制环境或视觉风格。
  • 视频 1 控制动作与运镜。
  • 音频 1 控制声音。

MiniMax 的完整参考指南区分了主体、图片锚点、视频结构和音频信号,进一步说明参考素材之间的关系应明确表达,而非留给模型推断。

MiniMax H3 R2V 参考素材容量


MiniMax H3 ref_image_size:match 与 max

ComfyUI 提供两种实用的参考图片策略。match 优先考虑速度,会将参考图片缩放至接近生成分辨率;max 则最多保留短边 2048 像素,以提高身份还原度,但处理成本也更高。

对于人脸、产品或精细的角色资产,max 带来的效果可能值得更慢的迭代。对于环境或整体风格参考,match 通常是更高效的起点。

MiniMax H3 分辨率:本地 768p 与 2K 输出

“MiniMax H3 支持 2K”需要结合上下文理解。

本地 MiniMax H3 生成什么分辨率?

开放的 H3-Base 工作流输出768p 级别的视频。ComfyUI 建议使用 768 像素短边,完整质量的本地画布可采用约1344×768、16:9 比例;预览迭代则更适合较低的百万像素设置。

MiniMax H3 如何生成 2K?

MiniMax 官方模型卡说明,完整的 H3 系统包含H3-Context-IR、H3-Base 和 H3-Regenerate-2K。H3-Base 先生成 768p 结果,H3-Regenerate-2K 再结合该结果与原始多模态上下文重新生成更高分辨率的细节,而非采用传统超分辨率处理。

MiniMax H3:本地与托管输出


Context-IR 和 Regenerate-2K 目前是托管组件,并不属于开放权重版本。MiniMax API 工作流支持最高 2K、每段 5–15 秒,因此本地 768p 生成与托管 2K 输出不应视为相同的工作流。

MiniMax H3 托管服务片段时长

MiniMax H3 需要多少显存?

很难给出有实际意义的单一最低显存数字,因为性能取决于显存、系统内存、分辨率、时长、步数、量化、卸载策略和注意力实现。

在我们整理的本地工作流记录中,一台 RTX 4090 Laptop 配置使用16GB 显存和 32GB 内存,配合 20 步与 Sage Attention,用 182 秒生成了带音频的 5 秒 960×540 视频。这是有参考价值的实际案例,但不是受控基准测试。

研究资料还包含一些低显存报告,其中通过大量卸载让 H3 得以运行。这里应区分:GPU 能完成生成,并不代表速度足以支持流畅的创意迭代。

MiniMax H3 本地生成报告案例


如何用 Sage Attention 加速 MiniMax H3

若要提高 H3 生成速度,先降低时长与分辨率。两者直接减少模型需要生成的视频量,让提示词测试成本显著降低。

在此基础上,Sage Attention 是文档中最明确的优化方式。ComfyUI 表示它可在质量损失很小的情况下,让 H3 生成速度提高约一倍,但具体提升幅度随配置而异。

专业工作流仍应对加速设置做 A/B 测试。使用相同提示词和随机种子,检查人脸、远处主体、产品细节、动作连贯性与音画同步,再决定是否采用较激进的加速方法。

MiniMax H3 常见问题与修复方法

问题

优先尝试的修复方法

R2V 忽略参考素材

确认加载 Ref2VA,并为每个参考素材指定明确职责

错误的角色说台词

保持说话者身份稳定,并将台词与该角色动作紧密关联

旁白时角色嘴唇在动

明确指定画外旁白,并说明可见主体不说话

身份发生变化

减少相互冲突的参考素材,或提高参考图片细节

生成太慢

缩短时长、降低预览分辨率、启用 Sage Attention

缺少 H3 节点

更新 ComfyUI 并重新加载官方 H3 模板

这套排查结构反映了我们整理 H3 用户问题时发现的高频问题。实际操作中,简化工作流往往比增加提示词指令更有效。

怎样的 MiniMax H3 工作流更适合生产?

对于专业视频与设计工作,我建议采用以镜头为单位的迭代流程:

预览 → 提示词 A/B → 参考素材 A/B → 选定版本 → 原生质量渲染 → 按需进行 2K 或后期处理 → 剪辑

这种方式让 H3 成为可控的创作系统。T2V 探索创意,I2V 固定设计好的构图,R2V 保持关键视觉或音频参考,而短预览能在高成本的最终生成前暴露问题。专门的MiniMax H3 生产工作流有助于规范这一顺序。

从产品设计角度看,相比让一条提示词同时解决创意、身份、镜头、动作、对白和后期问题,这种方式更容易扩展。目标不是减少决策,而是让每项决策成本更低、更易评估。这也凸显了了解MiniMax H3 适用场景的重要性,因为并非所有创作任务都需要同等程度的多模态控制。

常见问题

12GB 显存能运行 H3 吗?

通过量化模型与卸载,H3 可在资源有限的消费级硬件上运行,但仅凭显存无法预测生成速度。分辨率、时长、系统内存、模型变体、步数和注意力优化都会影响表现。更实用的硬件测试,是在计划实际使用的设置下,测量目标 5 秒预览的生成时间。

为什么 H3 R2V 参考素材不起作用?

先确认使用的是Ref2VA 而非 FL2VA。再为每张图片、每段视频或音频指定具体职责,如身份、环境、动作、运镜或声音。如果多个参考素材争夺同一属性的控制权,应先减少素材,再考虑增加提示词复杂度。

H3 提示词应使用 Shot 1 还是时间区间?

如果时间区间有助于规划分镜,可以用来做前期规划;但 MiniMax 官方基础提示词指南按顺序镜头组织最终提示词,后续镜头需注明切换时刻。这个区别很重要,因为有效的创意规划技巧未必就是模型文档规定的提示词结构。

本地 H3 能生成原生 2K 吗?

仅靠 H3-Base 不行。开放的 H3-Base 工作流输出 768p 级别视频。MiniMax 完整系统使用 H3-Regenerate-2K,结合原始上下文重新生成基础结果;官方 API 则可提供最高 2K 输出。

结语

MiniMax H3 更适合作为结构化的视听制作工作流,而非一条提示词生成视频的捷径。根据创作约束选择 T2V、I2V 或 R2V,正确使用 FL2VA 或 Ref2VA,为每个参考素材分配明确职责,描述可观察的镜头与运镜,并同步指导音频;先用低成本预览验证想法,再提高分辨率。实际最重要的问题,不只是硬件能否运行 H3,而是配置能否支持足够快的迭代,帮助你做出好的创作决策。待MiniMax H3 工作流稳定后,本地 768p 生成、托管 2K 后期处理与Virse便可融入更易扩展的专业AI 驱动设计流程。

更多 Virse 博客文章