如何用 MiniMax H3 替换视频角色并避免身份漂移
Vincent9 分钟阅读 ·

要用 MiniMax H3 替换视频角色,同时避免身份漂移,应将参考图像作为身份来源,将源视频作为表演来源。一个简单原则是:图像 = 身份,视频 = 表演,提示词 = 约束。这有助于 H3 保持新角色的脸和外观,同时保留原始动作、时序、姿态和运镜。
主要挑战是身份漂移。角色最初看起来可能正确,随后却逐渐变回原表演者;快速动作、遮挡、长片段或冲突参考都会加剧不一致。我们的MiniMax H3 评测审阅了有记录的 H3 流程,其中包括一项历时六小时、生成超过 400 次的研究,以及多角色、高速动作、取景和本地 ComfyUI 测试。在这些案例中,明确参考职责、使用短测试片段、提供有力的身份锚点,以及明确保留规则始终是最有用的流程原则。
对于管理这类大量依赖参考的 AI 工作流程的创意团队,Virse 提供更有条理的流程组织方式。Virse 不把每个决定都塞进聊天框,而是采用无限画布,让参考、输出和创作关系保持可见,多个 Agent 还能在同一项目中协作并共享上下文。凭借对团队偏好、品牌标准和项目知识的长期记忆,Virse 帮助专业设计师在保有创作控制权的同时,迭代并扩大 AI 辅助制作。 MiniMax H3、Seedance 2.5 和 Seedance 2.0 现已上线 Virse,团队可以在同一个创作流程中探索和比较多款领先的视频模型。

MiniMax H3 角色替换如何工作?
H3 角色替换不只是换脸
传统换脸主要改变面部外观。MiniMax H3 可支持更广泛的图像生成和编辑,其中面孔、发型、服装、颜色、轮廓和身体身份可以改变,同时保留原始动作和摄影方式。
最实用的理解方式很简单:
图像 = 身份。视频 = 表演。提示词 = 分工与约束。
图像回答新角色应该长什么样。视频回答该角色应该如何移动、表演以及与场景互动。
这种区分解释了几种常见失败。在有记录的流程中,有些输出改变了头发或服装,却过多保留原始面孔;另一些则过度保留源视频,以至于请求的角色替换几乎没有发生。
图像、视频和音频参考需要明确职责
参考质量比参考数量更重要。
输入 | 最佳职责 |
角色图像 | 面孔、头发、服装、比例、身份 |
源视频 | 动作、姿态、表情、位置、时序 |
源视频 | 镜头、取景、光照、场景、遮挡 |
音频参考 | 需要时提供声音、语调或音频上下文 |
提示词 | 定义替换、继承和保留 |
目标不是填满每一个可用的参考槽位,而是让每份参考对一种明确的信息负责。
如何准备最佳 MiniMax H3 角色参考
先用一张有力的肖像,再添加更多图片
对于近景和中景,一张清晰肖像往往是最佳起点。
我们的审阅发现,有些流程中减少参考图片数量反而提高了身份准确性。额外图片可能在发型、面部结构、服装、光照或比例上引入细微矛盾。
好的第一张参考应提供:
- 清晰可见的面孔
- 可识别的发型
- 一致的服装
- 尽量少的遮挡
- 足以锚定身份的面部细节
只有在能解决特定信息缺失问题时,才添加另一个视角。
全身动作与转身使用角色设定板
当表演者旋转、侧身出现或背向镜头时,单张肖像的作用会减弱。
对于这些片段,结合正面、背面和面部特写的角色设定板能提供更全面的信息。这对独特发型、夹克、鞋履或服装尤其有用,因为它们必须在动作迁移和转身过程中保持一致。
从设计流程角度看,这类似传统角色三视图:模型在该视角以动态形式出现之前,就先获得相关视觉信息。
让参考取景匹配目标镜头
取景是一个容易被忽视的变量。
一个有记录的流程将参考调整为约864 × 480、使其更接近目标构图后,一致性有所改善。另一个案例使用848 × 1264 的全身 PNG配合1280 × 720、30 fps、14.4 秒的源片段,但仍出现明显身份漂移。
这些并非对照基准测试,但支持一条实用原则:应让定义身份的特征足够大、足够清晰,以适应角色在最终镜头中的大小。

如何逐步用 MiniMax H3 替换视频角色
第 1 步:让源视频主导表演
让源视频控制动作、姿态、位置、身体旋转、面部表演、速度、时序和动作编排。
如果源视频已经包含想要的表演,不要用文字重新描述每个动作。重新描述动作可能增加一层解释,而不是提高保真度。
第 2 步:指定参考图像为身份来源
明确说明:应将原始表演者替换为参考图中的角色。
定义必须保持稳定的视觉属性,包括面孔、发型、服装、颜色、比例和独特细节。
一项有记录的研究在约六小时内进行了超过 400 次生成,其中主体定义薄弱与部分测试轮次中约半数出现身份丢失有关。启示并非每个流程都会如此,而是当一致性很重要时,模糊身份标签存在风险。
第 3 步:迁移原始表演
替换后的角色应继承原表演者的动作、姿态、位置、表情、旋转、速度和时序。
这条指令至关重要,因为它告诉 H3,原表演者提供的是表演,而不是身份
第 4 步:保留镜头、光照和场景结构
保护目标角色编辑范围之外的一切。
保留背景、道具、镜头路径、取景、焦点、运动模糊、光照、阴影、构图和剪辑时序。
H3 需要重新设计的无关元素越少,就越容易将模型能力集中在替换本身。
第 5 步:保留遮挡关系
当手、头发、道具、武器、服装或其他角色经过主体前方时,遮挡关系非常重要。
如果源视频中一只手掠过面孔,它也应在同一时刻掠过替换后的脸。弓、装备、前景物体和角色重叠同样如此。
这在舞蹈、跑步、拳击、射箭、快速转身和动作场景中尤其重要。
最佳 MiniMax H3 角色替换提示词是什么?
使用替换、匹配、继承、保留和禁止五部分
最有力的通用提示词框架是:
替换:将原始表演者替换为参考角色。
匹配:匹配角色的面孔、头发、服装、颜色、比例及可识别的身份细节。
继承:保留原始表演者的动作、姿态、表情、位置、速度、旋转和时序。
保留:保持原始镜头、背景、光照、阴影、道具、取景、焦点和剪辑。
禁止:不要引入新动作、物体、切镜、镜头运动、文字或配饰。
因此,一条简洁的制作提示词可以这样写:
在视频 1 中,将原表演者替换为图像 1 中的角色。在整个片段中,匹配参考角色的面孔、发型、服装、颜色、身体比例和可见身份细节。保留原表演者的动作、姿态、位置、旋转、表情、速度和时序。保持背景、道具、镜头路径、取景、焦点、运动模糊、光照、阴影、构图和剪辑不变。当手、头发、服装或物体经过角色前方时,维持原有遮挡关系。不要添加新动作、物体、镜头运动、切镜、文字或配饰。
简单提示词可能优于过度结构化提示词
提示词更长并不自动意味着更可控。
一个有记录的头部替换流程中,简化指令在约70% 的尝试中取得良好效果,而更复杂的版本有时过多保留源内容,导致几乎没有发生替换。
当结构化提示词能解决具体问题时,它才更有用,例如多角色映射、持续身份漂移或参考冲突。
如何修复 MiniMax H3 身份漂移
先用短片段,再增加时长
身份漂移往往逐渐出现。角色可能开始时正确,随后变得像源表演者,再部分恢复。
一次14.4 秒、1280 × 720、30 fps测试使用848 × 1264 全身参考,在16GB RTX 5070 Ti流程中仍出现明显漂移。
更高效的排查顺序是:
- 测试约五秒的片段。
- 加强面部参考。
- 更贴近地匹配取景。
- 移除不必要的参考。
- 明确身份与表演职责。
- 为转身镜头添加背面视图。
- 测试另一个种子。
- 对高难度动作提高质量设置。
高速动作可能需要更保守的设置
在生成超过 400 次的流程中,五秒片段常用于测试,另外还进行过15 秒实验。
四步 Turbo 设置适合迭代,但高难度动作有时会丢失身份一致性。遇到更难的段落,该流程会回到约20 步。

这不是通用预设,而是体现更广泛的取舍:当模型必须同时处理身份、姿态、动作、遮挡和时间连续性时,更快的生成可能变得不够可靠。

在切镜和较长视频中保持 H3 角色身份一致
更长的段落和硬切会增加源身份重新出现或参考相互竞争的机会。
在制作中,先在短小、独立审阅的片段中验证替换,再延长段落。不同片段保持相同的身份描述和参考映射,并在每次切镜处检查连续性。
不要假设第一镜头正确建立的角色,会在后续镜头中自动保持主导。跨片段一致性应作为明确的制作任务,而不是一次性的提示词决策。
如何用 MiniMax H3 替换多个角色
明确映射每个角色
替换两个人物时,每个身份都需要稳定映射。
一种实用结构是:
- 图像 1 定义角色 A
- 图像 2 定义角色 B
- 视频 1 提供两人的表演
- 角色 A 替换左侧表演者
- 角色 B 替换右侧表演者
一个有记录的双角色流程在改进主体映射和保持后,达到了约90% 的报告成功率,但结果仍依赖种子。

防止交叉时的身份混合
最难的时刻,是表演者交换位置、重叠或相互遮挡时。
明确指定角色 A 和角色 B,比“第一个人”“第二个人”这样的模糊标签更稳妥。
多角色工作中,参考职责清晰比用满参考数量更有价值。
MiniMax H3 的 ComfyUI 性能测试说明了什么?
12GB 显存可以运行,但取舍明显
一个RTX 3060 12GB流程报告的大致情况是:
- 约 2MP 下生成 5 秒
- 约 1.34MP 下生成 8 秒
- 1.34MP 生成耗时约 25 分钟
另一次 12GB 测试在 0.4MP 下使用九张高清 PNG 参考。普通的 30 秒图生视频耗时约14 分钟,而多参考 Ref2V 流程耗时约20 分钟。
这些结果是流程示例,而不是通用基准,但展示了时长、分辨率、参考数量和生成成本之间的取舍。

更多显存不会自动解决身份漂移
一个 16GB 流程在较长替换片段中仍出现漂移。
一次24GB RTX 3090 Ti测试使用0.5MP、56 帧,将视频编辑描述为大约需要简单图像参考生成的两倍资源。
一个更高端的 5090 优化流程在切换到更节省内存的组件后,报告显存节省超过 10GB,且共享 GPU 内存占用减少约 14GB,而生成速度基本相近。
关键在于,GPU 容量影响你能运行哪些设置,但参考质量、时长、动作复杂度和提示词结构仍然决定身份稳定性。

MiniMax H3 角色替换最常见的错误是什么?
未诊断失败就添加更多参考
更多参考可能产生更多矛盾。
从一份有力的身份来源开始。只有当目标片段暴露第一张图无法提供的信息时,才添加另一个视角。
过早测试长视频
一段失败的 15 秒动作片段可能有很多原因。
五秒测试更容易在投入更多算力之前,定位身份、取景、动作、种子、分辨率或遮挡问题。
同时改变过多元素
如果任务是角色替换,避免同时改变背景、光照、镜头、动画和剪辑风格。
专业AI 视频流程在每次生成都有狭窄的变换边界时,会更可控。
常见问题
为什么 H3 保留原始面孔?
最常见的原因是身份参考薄弱、参考职责模糊、取景不匹配、参考过多,或者保留指令压过编辑要求。先用一张清晰肖像,指定图像负责身份、视频负责表演,并在增加复杂度之前用短片段验证替换效果。
H3 能同时替换两个角色吗?
可以。当每份参考明确映射到一名表演者时,多角色替换可以生效。主要挑战是角色重叠、交换位置或相互遮挡时发生身份混合。稳定的角色 A 和 B 映射比模糊的位置描述更可靠。
H3 应该使用多少张参考图?
先从一张有力的图片开始。只有源视频展现第一张图无法提供的信息,例如背面发型或服装视图时,才添加另一个视角。在多个有记录的流程中,更少参考反而改善了一致性,因为模型需要协调的冲突视觉信号更少。
H3 需要多少显存?
没有唯一固定要求。有记录的本地流程包括在12GB、16GB 和 24GB GPU上可运行的案例,但分辨率、时长、步数、量化、模型配置和参考数量都会影响内存使用。对于受限硬件,应先降低片段时长和分辨率。
结论
最佳 MiniMax H3 角色替换流程,不是围绕一条“终极提示词”建立,而是让每个信息源负责正确的事情:参考图像定义身份,源视频定义表演和摄影,提示词定义哪些内容必须改变、迁移和保持不动。在数百次有记录的生成、多角色案例、高动作测试、取景实验和本地 GPU 流程中,最有力的规律始终一致:从短片段开始,使用最少数量的优质参考,将身份与表演分开,明确保留镜头和遮挡,只有具体失败需要时才增加复杂度。
更多 Virse 博客文章
工作流

GPT Image 2.5 Noise and Oversharpening: Why Some Images Still Look AI-Generated
2026年10月9日 by Yifan Zhao
工作流

GPT Image 2.5 Keeps Changing My Image: How to Use a "Keep List" for Reliable Edits
2026年10月9日 by Yifan Zhao
工作流

GPT Image 2.5 Editing Drift: Why Images Get Blurry, Cropped or Worse After Multiple Edits
2026年10月9日 by Yifan Zhao