如何使用 MiniMax H3 动作迁移:视频转视频指南
Yifan Zhao9 分钟阅读 ·

MiniMax H3 动作迁移可让参考视频控制动作、节奏、运镜或表演,同时由独立的图像与音频参考定义角色身份、外观和声音。如果你正在学习如何使用 MiniMax H3,核心难题并不是让 H3 识别动作,而是确保每份参考素材都控制正确的属性。
视频参考还包含演员、背景、构图、表情、镜头行为,通常也包含音频。这些信号相互竞争时,结果可能出现身份信息串入、动作偏移、背景变化或面部不一致。最可靠的MiniMax H3 工作流会通过明确界定哪些内容应保留、哪些应改变,以及每项决定由哪份参考素材负责来减少冲突。结构清晰的MiniMax H3 提示词能让这种分工更容易表达。
对于希望将这些工作流转化为可重复生产流程的团队,Virse将 AI 生成与面向专业创意协作的无限画布工作空间结合起来。其多 Agent 创意工作流方法让参考素材、输出与项目上下文保持关联,而更全面的从需求简报到交付的 AI 设计工作流帮助团队在多个模型之间分配任务。付费套餐包含 Nano Banana 2、GPT Image 2 等 40 多个模型的无限使用权限,以及不限数量的席位。新用户还能获得免费积分,足够生成约 10 张 Nano Banana 2 图像或 1 段 Seedance 2.0 视频。

什么是 MiniMax H3 动作迁移与参考生成?
最好将 MiniMax H3 动作迁移理解为 H3 更广泛的参考生成系统的一种用途。H3 不必将源视频视为完整模板,而是可以结合图像、视频、音频和文字,让不同输入影响输出的不同部分。
MiniMax H3 动作迁移与传统 V2V 对比
传统 V2V 工作流通常在改变外观的同时保留源视频的大部分结构。H3 可以更有选择地保留内容。
参考素材 | 最适合的作用 | 主要风险 |
|---|---|---|
图像 | 身份、面部、服装 | 姿势或背景信息串入 |
视频 | 动作、节奏、运镜、表演 | 原演员或场景信息串入 |
音频 | 声音特征 | 声音不匹配 |
提示词 | 定义关系 | 指令冲突 |
有用的思路转变是从“改造这个视频”变为“决定这个视频应该贡献什么”。
本文查阅的现行 H3 参考生成规格最多支持9 张参考图像、3 段参考视频、3 段参考音频,以及总计 12 份混合参考文件。参考视频总时长最多 15 秒,参考音频总时长最多 15 秒,输出时长为 4 至 15 秒。

MiniMax H3 动作迁移、视频编辑与 I2V 对比
这些工作流解决不同的问题。动作迁移利用视频引导动作、节奏、运镜或表演。视频编辑从现有视频出发,更改选定内容,同时尽量保留其余部分。I2V从静态图像出发生成新动作,而不是复现视频源中的动作。
对设计师而言,这一区别很重要,因为动作迁移从根本上关注的是参考素材之间的关系,而不只是动画。了解MiniMax H3 的适用场景有助于判断 Ref2V、编辑或其他生成方式哪种更合适。
MiniMax H3 的参考属性分工如何改善动作迁移
分析 H3 最有用的框架是参考属性分工:每个输入都应有明确职责。
分别指定动作、身份、镜头和音频
以典型的角色替换为例:
视频 1 提供动作和节奏。图像 1 提供身份和外观。提示词定义哪些必须保留、哪些必须改变。
在另一个镜头中,视频 1 也可能改为提供镜头路径。特写视频可以提供面部表演。音频可以提供声音特征。
当多个来源争夺同一属性时,问题就开始出现。角色图像可能定义了新面孔,而视频却强烈强化原演员的特征。
增加提示词细节前,先减少参考信息串入
我们审阅记录在案的工作流和反复出现的用户问题后发现,许多表面上的提示词失败实际上是参考信息串入问题。
实用的操作顺序如下:
- 定义每个来源。
- 指定一项主要职责。
- 说明哪些属性必须保留。
- 说明哪些属性必须改变。
- 只描述新的目标内容。
明确的职责划分通常比提示词长度更重要。
如何编写 MiniMax H3 动作迁移提示词
好的 MiniMax H3 动作迁移提示词应让参考素材之间的关系易于理解。在更全面的MiniMax H3 提示词指南中介绍的同样原则,在多份参考素材需要承担不同职责时尤为重要。
使用“参考素材、职责、保留内容、目标内容”结构
实用的提示词可以很简单:
视频 1 是动作参考。图像 1 是角色参考。让图像 1 中的角色执行视频 1 的动作与节奏。保留角色的身份、发型、体态外观和服装。将角色置于光线柔和的摄影棚中。
其中包含四个有用层次:参考素材、职责、保留内容和目标内容。
不要再次控制参考素材已经控制的内容
当多个角色或参考素材存在歧义时,详细提示词可能有帮助。但更长并不一定更好。
镜头迁移就是一个好例子。如果视频 1 已经包含所需的镜头路径,再描述同样的环绕、速度、距离和方向,可能引入相互竞争的指令。
用文字消除不确定性,而不是重复参考素材中已明确的信息。
如何使用 MiniMax H3 Ref2V 替换角色
角色替换是 H3 最明确的应用之一,因为动作和身份可以来自不同来源。
单角色替换与参考素材构图
让参考素材匹配目标表演。全身动作用全身图像,面部表演用特写图像。
然后分别评估输出的以下方面:
- 身份;
- 服装;
- 动作节奏;
- 镜头;
- 环境。
即使视觉效果很吸引人,若面孔改变或原表演者仍有部分可见,结果依然可能不合格。
双角色替换案例研究
一个记录在案的工作流使用了10 秒双人舞蹈视频以及两张独立的角色图像,目标是在保留原动作与环境的同时替换两位表演者。
完善保留指令后,该工作流报告称,在这一特定配置中替换成功率约为 90%,但种子变化仍会影响结果。

这不是 H3 的通用准确率。它说明了更有价值的一点:多角色参考分工是可行的,但仍具有概率性,而非确定性。
如何在不破坏 MiniMax H3 动作迁移的前提下更换背景
在同一次生成中更改角色、动作和环境,会产生更多相互竞争的条件。
单轮 Ref2V 何时会变得不稳定
走路、转身或简单手势等大幅度动作,在同时更换角色与背景时可能仍能保留。
精细手指动作、面部表演、嘴唇动作和复杂编舞则更敏感。我们的审阅发现,同一轮生成中加入环境替换时,这些细节更容易偏移。
复杂动作与背景变化采用两轮处理
对于高难度镜头:
- 替换角色,同时保留源视频的动作与环境。
- 确认身份、双手、面部和节奏。
- 将成功输出作为下一次的视频参考。
- 在第二次生成中替换背景。
当多项变换相互竞争时,将其拆开处理,可能比扩充提示词更能改善控制。
如何在 MiniMax H3 中迁移运镜与面部表演
动作迁移不局限于身体动作。视频参考还可以提供镜头轨迹与表演。
MiniMax H3 镜头迁移
当参考素材已提供镜头运动时,让视频控制这一运动,并用提示词定义新的主体与环境。
这样可以避免两个来源各自独立控制同一种镜头行为。
进行镜头迁移时,描述镜头中新加入的内容,不必多余地重写参考镜头已有的运动方式。
MiniMax H3 面部表情与表演迁移
参考素材能清晰呈现细微动作时,面部表演效果最好。与远景相比,紧凑特写能更有效地传递眼球运动、眉毛变化、表情变化与手势节奏的信息。
身体几何结构也很重要。将人类动作映射到比例差异很大的角色,尤其是四足主体时,需要更多解释推断,也会增加偏移的可能性。
如何改善 MiniMax H3 的角色一致性
角色一致性既取决于提示词设计,也同样取决于参考素材设计。
让参考素材构图匹配目标镜头
一个记录在案的一致性工作流使用了两张 1024 × 1024 的角色上半身参考图,以1376 × 768生成,同时结合角色与声音参考。观察发现,面部距离镜头更近时,面部一致性更好。
实际启示是,身份保留在一定程度上是摄影构图问题。H3 需要足够的可见信息,才能辨识定义性特征。
参考图像分辨率存在取舍
另一个工作流报告称,增大参考图像的有效尺寸后,相似度有所改善。在该配置中,最长边约为2500 像素或以下的参考图仍然实用,而 4K 以上图像会让处理大幅变慢。
这并不能证明每个工作流都应追求最大分辨率。更有力的证据支持的是良好的构图与清晰可辨的身份信息,而非严格匹配像素数或宽高比。
分辨率与算力如何影响 MiniMax H3 Ref2V
更高分辨率改变的可能不止清晰度,也可能影响提示词遵循程度、身份一致性和生成成本。
352p、416p 与 768p 的表现可能不同
在一个使用4 块 B300 硬件的受控 Ref2VA 工作流中,同样的提示词在 352p 和 416p 下,比在 768p 下更稳定地保留了镜头结构、拍摄角度与角色位置。
增加采样步数改善了视觉连贯性,却未完全恢复结构控制。其他记录在案的工作流得到不同结果,因此不能将其视为通用的分辨率规律。

更高分辨率并不自动意味着更强的参考遵循能力。
即使使用高端硬件,Ref2V 仍可能开销很高
一个复杂的 V2V 工作流使用配备 96GB 显存的 RTX PRO 6000 Blackwell,以及 128GB DDR5,设置约为0.4 MP、20 步,报告称生成3–10 秒片段约需 2–10 分钟。
对制作团队而言,高效的做法是先在成本较低的设置下验证参考分工、身份与动作,再投入最终分辨率的生成。

H3 如何处理音频与长视频续接
音频与连续性还带来两个容易被忽略的参考控制问题。
H3 声音参考不等于精确保留语音
我们审阅到的部分工作流会重新合成参考语音,而不是原样复制。在一个记录在案的案例中,视频与参考音频之间约0.1 秒的时差,就可能导致漏词或语调变化。
关键区别很简单:
声音参考不等于精确保留波形。
因此,对对白要求严格的工作流应将原始音频作为独立制作素材处理。
H3 长视频续接更适合采用短片段串联
一个记录在案的续接工作流会先生成10 秒片段,再将最后的2 秒,即 24 fps 下的 48 帧作为下一次生成的上下文,并重新加入角色参考。

这种做法改善了动作连续性,但仍可能出现色彩漂移与偶发的状态变化。
对于更长的片段,采用短片段并传递上下文,比假设一次生成就能无限期保留所有内容更切合实际。
MiniMax H3 动作迁移最佳实践
在制作中,以下决策提供了最明确的起点:
场景 | 推荐方法 | 原因 |
|---|---|---|
简单角色替换 | 单轮 Ref2V | 减少相互竞争的变化 |
精细动作加新背景 | 两轮处理 | 保护细微动作 |
镜头迁移 | 让视频负责镜头 | 减少文字冲突 |
面部表演 | 特写参考 | 表演更易辨识 |
最终高分辨率输出 | 先做低成本测试 | 节省算力 |
长片段 | 串联短片段 | 更好地控制上下文 |
总体原则是一致的:使用干净明确的参考素材,让构图匹配目标表演,为每个来源指定明确职责,并在还原度开始下降时拆分变换。
常见问题
如何让 H3 只复制动作,而不复制原人物?
明确将视频作为动作来源,将身份交给图像参考负责。清楚说明图像中哪些内容必须保留,视频中哪些内容应该迁移。如果原表演者仍然残留,就简化源素材,减少相互竞争的身份信号。
为什么 H3 角色替换有时会保留原角色或改变背景?
视频可能不仅影响动作,还在影响身份或环境。更干净的参考素材、相匹配的构图、明确的职责分配,以及将角色替换与背景替换分开,都有助于减少这种串入。
应采用单轮还是两轮 Ref2V?
简单动作先从单轮开始。如果精细手部动作、面部表演、嘴唇动作、复杂编舞以及背景替换都必须准确,就采用两轮。先锁定角色与动作,再更改环境。
H3 能精确保留参考视频中的语音吗?
根据本文审阅的工作流,不能可靠地做到。语音可能被重新合成、更改,或因时间变化而变得不准确。如果对白必须精确,就应单独保留源音频,不要假设 Ref2V 会原封不动地复现它。
结论
当将 MiniMax H3 动作迁移视为多模态参考架构,而非简单的 V2V 效果时,其可控性会显著提升。最有效的工作流将身份、动作、镜头、表演、环境和音频分别交给明确的来源;尽量减少冲突指令;使用与目标镜头相匹配的参考素材;提高分辨率前先高效测试;必要时把复杂变换拆分为多轮。最有用的问题不再是“怎样写更长的 H3 提示词?”,而是“这个镜头的每个部分应由哪份参考素材控制?”
作者:Yifan Zhao — AI 设计工作流策略师与创意技术顾问。
更多 Virse 博客文章
工作流

GPT Image 2.5 Noise and Oversharpening: Why Some Images Still Look AI-Generated
2026年10月9日 by Yifan Zhao
工作流

GPT Image 2.5 Keeps Changing My Image: How to Use a "Keep List" for Reliable Edits
2026年10月9日 by Yifan Zhao
工作流

GPT Image 2.5 Editing Drift: Why Images Get Blurry, Cropped or Worse After Multiple Edits
2026年10月9日 by Yifan Zhao