如何用 MiniMax H3 创建一致的 AI 角色,无需复杂 ComfyUI 工作流程
Vincent8 分钟阅读 ·

通过复用相同的角色参考、锁定身份属性,并把身份与镜头级变化分开,你就能用 MiniMax H3 创建一致的 AI 角色,而无需管理复杂的 ComfyUI 工作流程。保持脸部、发型、服装、身体轮廓及其他固定特征一致,再主要用提示词控制动作、场景、镜头运动、灯光和临时细节。
角色一致性通常会在镜头角度改变、多个人物同场、服装漂移,或多个片段串成长序列时开始崩坏。仅加长提示词很少能解决这些问题。缺乏稳定的身份锚点和明确的参考分配,H3 就可能在镜头之间引入面孔混合、身份漂移、服装变化和连贯性错误。
更可靠的流程结合了参考包、多角度角色设定图、明确的参考映射、短时质检生成,以及长视频的前序帧上下文。对于希望获得这些控制、却不想直接操作大型节点图的团队,Virse提供无限画布、共享项目上下文、多 Agent 协作与长期记忆,帮助创作者整理可复用的角色参考,把一致性变成可重复执行的制作流程。MiniMax H3、Seedance 2.5和Seedance 2.0现已上线Virse,因此团队可以在同一创意流程中探索并比较多个领先的视频模型。

MiniMax H3 如何在不同镜头中保持角色一致性?
MiniMax H3 的角色一致性依赖于区分两个问题:身份一致性与时间连续性。
身份锚点告诉 H3 角色是谁。它可以包括面部参考、全身图、服装参考、多角度角色设定图,以及固定的身份描述。时间锚点则通过传递前序帧或其他连续性信息,告诉 H3 下一段开始前刚刚发生了什么。
身份一致性与时间连续性需要不同的锚点
在较长序列中,这种区别很重要。在一个记录在案的 1 分钟以上流程中,前一片段的 22 帧与两张角色设定图一起复用。另一个续接流程传入最后的48 帧,即 24 fps 下约两秒,同时继续提供相同的主体参考。
实用经验很简单:参考保留角色是谁,前序帧保留场景此前在做什么。

多角色场景会增加参考与调度问题
我们审阅反复出现的 H3 用户问题时,经常发现身份串扰、面孔混合、身体重叠、面孔拉伸,以及参考分配错误等问题。
对双角色场景,应分别定义每个角色,明确映射参考,并在加入复杂动作或镜头运动前,确定各自站位。当画面中出现不止一个身份时,角色一致性也部分变成了场面调度问题。
为何 MiniMax H3 的参考图比更长的提示词更重要?
H3 的一条实用规则是:参考定义身份;提示词定义变化。
将脸部、发型、服装、身体轮廓与标志性配饰留在参考系统中。镜头提示词则用于动作、环境、镜头方向、灯光、节奏和临时物品。
改变镜头前先锁定身份属性
一个记录在案的角色替换工作流程在生成指令中反复强化发型、眼睛、开衫和配饰等稳定细节。这有助于保持身份,但文字最适合用来强化视觉参考,而不是替代视觉参考。
在实际 AI 视频制作中,每次改变更少的变量也更容易诊断失败。如果发型、服装、镜头角度、环境、风格和动作一起改变,就很难识别是什么导致了角色漂移。
MiniMax H3 应使用多少张参考图?
H3 并没有经过验证的通用参考数量。我们的研究发现,有些可复用角色系统使用约4–6 张参考,而其他流程依赖更精简的正面、侧面和背面角色设定图。
更好的问题是,每张图是否增加了有用的身份信息。
构建互补的 H3 参考包
实用参考包可以包括:
- 面部特写,用于面部身份和头发细节
- 正面或四分之三角度视图,用于常见人像角度
- 侧视图,用于侧脸信息
- 全身图,用于服装、轮廓和比例
- 背面或其他视图,用于角色需要转身背对镜头时
六张几乎相同的人像并不自动胜过三张互补视图。
让特写和全身参考各司其职
特写是面部镜头更强的身份锚点。全身图有助于保留服装和身体比例。
这种区别很重要,因为审阅中有一个案例,将848×1264 的全身参考用于构图差异很大的目标画面,结果相似度较弱,并出现明显身份漂移。
MiniMax H3 最适合什么参考尺寸与构图?
参考预处理会实质影响结果,但现有证据不支持一种通用分辨率。
在一个记录在案的流程中,参考图被调整为目标视频的864×480原生格式,据报告一致性有所改善。这并不意味着 864×480 是 H3 最佳参考尺寸,而是提示参考与目标镜头的适配性可能很重要。

让参考匹配你想生成的镜头
近景人像应提供充分的面部信息。全身动作则要确保参考包明确交代服装与轮廓。
也要避免参考在发型、服装、比例或角色年龄上相互冲突。更多参考只有在补充一致的信息时才有用。
为何要制作 MiniMax H3 角色设定图?
角色设定图把参考准备从重复任务变成可复用的制作资产。
一个H3 工作流程根据面部与服装输入生成正面、侧面和背面参考。在24GB 显存的 RTX 3090上,第一阶段耗时约100–125 秒,第二阶段约105 秒,完整设定图约需3.5 分钟。

创建一次角色,反复复用
对于持续制作,应保存:
- 已批准的参考视图
- 固定身份描述
- 服装定义
- 标志性配饰
- 已批准的表情
- 角色名称或内部 ID
这会把工作流程从每次生成都重新创建人物,转变为为新镜头选择已有角色。
对叙事视频、广告变体、品牌角色与剧集内容,这样更容易规模化。
应如何在 MiniMax H3 中分配多份参考?
多参考工作流程在每份参考都有明确角色时更容易控制。
一个记录在案的测试,用四份独立参考分别对应角色、便利店、汽车和滑板,饮料杯则通过文字添加。在RTX 5070 Ti、32GB RAM的配置上,生成耗时约9 分 7 秒,报告的每次迭代耗时为68.43 秒。
为必须保持一致的内容提供参考
另一个流程分别指定了角色、滑板、环境和 Walkman。
制作原则比任何单个例子都更普遍:外观必须稳定的资产用参考,临时或低优先级细节用文字描述。
对于多个角色,应先映射角色 A 与角色 B,再定义互动、镜头运动和动作。
如何更快测试 H3 角色一致性?
角色一致性通过迭代改善,因此测试速度很重要。
在一个RTX 4070 Ti 12GB流程中,15 秒、0.4MP的生成耗时约18 分钟。降到0.2MP后,相同视频时长的生成耗时降至7 分钟以内,而短的1–2 秒测试在该配置下约一分钟或更短就能完成。
这些数字是个别工作流程的结果,并非通用的H3 基准。

采用草稿、预览、最终版流程
实用的质检顺序如下:
- 草稿:检查面孔、参考分配和场面调度。
- 预览:检查动作、取景和连贯性。
- 最终版:身份检查通过后,再增加时长和分辨率。
性能还高度依赖内存处理。一个RTX 4070 12GB配置用167 秒生成了 608×352 输出,而另一个 12GB 流程因内存管理行为,速度从约每次迭代 18 秒降至每次迭代超过 400 秒。
重点不是哪张 GPU 最快,而是迭代效率也是一致性流程设计的一部分。
如何在多个片段中保持同一个 H3 角色?
对 H3 长视频,应保持相同身份参考,同时从前一片段传递时间信息。
一个要求较高的连续性测试串联了8 个镜头、1,689 帧、约 70 秒视频与 7 次续接。它在RTX 3090 上以 1344×768、20 步运行,总耗时约3.4 小时。
同时复用角色参考与前序帧
整个链条中角色仍能辨认,但背景细节在约四至五次衔接后明显变弱。

这个结果突出了一个重要区别:身份可以保持稳定,而环境却逐渐劣化。
因此,长序列更适合定期质检,并在需要时刷新地点参考,而不是无限续接。
首尾帧还是前序上下文:H3 该选哪一个?
这些MiniMax H3 方法解决的是不同问题。
首尾帧适用于镜头必须抵达指定视觉状态的情况。但对最后一帧施加过严约束,有时会使临近结尾的动作不自然地变慢。
前一片段上下文更适合连续动作,因为它会向后传递运动历史。
一个有用的框架是:
角色参考 = 身份连续性
前序帧 = 时间连续性
首尾帧 = 状态控制
对长序列,这些机制可以互补,而非互相替代。
如何不靠复杂的 ComfyUI 工作流程使用 MiniMax H3?
目标不一定要彻底移除 ComfyUI。更好的目标是从创作者体验中移除节点图的复杂性。
我们审阅反复出现的用户问题发现,创作者强烈需要这样的界面:选择角色、挑选参考、描述镜头、设置质量,然后生成,无需管理自定义节点、模型路径、注意力设置或显存配置。
让 ComfyUI 留在后端
一个12GB 显存流程约用14 分钟生成 30 秒输出,同时借助浏览器式前端简化交互。
另一个配置通过 MCP 将 AI 助手连接到 ComfyUI。在RTX 3080、10GB 显存与 32GB RAM上,该流程使用20 步,每个片段约需25 分钟,之后进行2 倍放大至 1080p。
从产品设计角度,理想交互是:
选择角色 → 选择地点 → 描述镜头 → 选择质量 → 生成
节点图可以保留在底层。创作者不应被迫用节点来思考。
如何将 H3 角色一致性扩展到地点与道具?
一旦角色稳定,下一个挑战就是让视觉世界的其余部分也保持一致。
一个地点工作流程在某些情况下需要生成超过 10 次,才能得到满意环境。随后选出四个透视视图,复用为地点参考。

建立角色库、地点库与道具库
要实现可重复的 AI 视频制作,应把持久资产整理为:
- 角色库
- 地点库
- 道具库
反复出现的汽车可能值得提供参考,只出现一次的一次性杯子则未必需要。
更广泛的原则很简单:锁定必须保持一致的内容,用提示词描述允许变化的内容。
结论
用 MiniMax H3 创建一致的 AI 角色,最好将其视为制作系统问题,而不是提示词写作技巧。建立可复用的多角度角色资产,使参考匹配计划生成的镜头,固定身份属性,明确分配重要参考,并在最终渲染前通过短预览验证角色。对较长序列,应结合相同身份锚点与前序帧上下文,并监控多次续接中的劣化。最易规模化的 H3 工作流程,最终会把技术复杂性隐藏在后端,让创作者专注角色、地点、道具和镜头指导,而不是反复重建身份或管理大型 ComfyUI 节点图。
常见问题
要保持 H3 角色一致性,应使用多少份参考?
没有经过验证的通用数量。我们的审阅发现,有些流程使用约4–6 份参考,其他则依赖更精简的多角度角色设定图。优先选择互补视图,而不是重复图像。良好的面部参考、侧视图和全身图,往往比几张几乎相同的人像提供更有用的身份信息。
H3 参考图应该是特写、全身图,还是与视频分辨率相同?
让每份参考承担具体职责。特写支撑面部身份,全身参考建立服装与轮廓。一个记录在案的流程报告,将参考调整到 864×480 后一致性提升,但这不是通用规则。构图适配性和有用的身份信息,比盲目最大化分辨率更重要。
如何避免两个 H3 角色混脸?
给每个角色独立参考,明确映射这些参考,使人物在视觉上可区分,并在加入复杂互动前定义站位。当参考分配、动作、镜头方向与空间关系同时含糊时,身份串扰会更难控制。
如何不管理 ComfyUI 节点,就在长视频中保持同一个 H3 角色?
每次续接都复用相同的角色参考,并传入前一片段的一小段作为时间上下文。已有记录的流程使用过前序 22 帧,或48 帧,即 24 fps 下约两秒。ComfyUI 可以留在后端,让创作者通过更简单的界面处理角色、场景、时长与质量。
更多 Virse 博客文章
工作流

GPT Image 2.5 Noise and Oversharpening: Why Some Images Still Look AI-Generated
2026年10月9日 by Yifan Zhao
工作流

GPT Image 2.5 Keeps Changing My Image: How to Use a "Keep List" for Reliable Edits
2026年10月9日 by Yifan Zhao
工作流

GPT Image 2.5 Editing Drift: Why Images Get Blurry, Cropped or Worse After Multiple Edits
2026年10月9日 by Yifan Zhao