Guide des références MiniMax H3 : images, vidéo et audio expliqués
Yifan Zhao13 min de lecture ·

Les références MiniMax H3 permettent aux créateurs de contrôler l’apparence, les mouvements et le son d’une vidéo à partir de sources distinctes. Les images conviennent surtout à l’identité, aux costumes, aux produits et aux décors ; les vidéos aux mouvements, à l’interprétation, à la caméra et au rythme ; l’audio au timbre vocal, à la musique, au rythme et aux caractéristiques sonores. Ces contrôles sont particulièrement importants dans le transfert de mouvement de MiniMax H3, où différentes références peuvent gérer séparément identité, mouvement, caméra et son.
Le défi consiste à empêcher ces références de se concurrencer. Une vidéo de mouvement peut laisser passer des traits d’apparence, plusieurs images peuvent se disputer l’identité, et Ref2VA peut échanger de la netteté contre davantage de souplesse. En pratique, les meilleurs résultats viennent d’une définition préalable de ce que chaque référence doit préserver, transférer et ignorer. Un prompt MiniMax H3 structuré et un flux MiniMax H3 reproductible facilitent le contrôle de ces responsabilités.
Pour les équipes qui développent ces flux à plus grande échelle, Virse réunit références, ressources et plusieurs Agents IA sur un canevas infini, avec un contexte créatif partagé et une mémoire visuelle à long terme. Virse donne accès à plus de 50 modèles sur un même canevas, dont Nano Banana 2, GPT Image 2 et Seedance 2.0, pour intégrer la génération guidée par références dans un flux de conception par IA plus global. Les nouveaux utilisateurs peuvent commencer avec des crédits gratuits ; les offres payantes donnent accès aux modèles premium et à l’utilisation illimitée de certains modèles rapides pour des productions plus importantes.

Que sont les références MiniMax H3 et comment fonctionnent-elles ?
Une référence MiniMax H3 est une image, une vidéo ou un audio qui fournit des attributs précis à une nouvelle génération. La manière la plus fiable d’utiliser H3 est de raisonner en termes de responsabilité de la référence plutôt que de type de fichier.
Référence | Idéal pour | Rôle habituel |
|---|---|---|
Image | Apparence stable | Identité, costumes, produit, environnement |
Image d’ancrage | État visuel précis | Composition, cadrage, état initial ou final |
Vidéo | Comportement temporel | Mouvement, interprétation, caméra, rythme |
Audio | Caractéristiques sonores | Voix, musique, rythme, texture |
Un schéma de production simple peut attribuer l’image 1 à l’identité, l’image 2 aux costumes, la vidéo 1 à la chorégraphie, la vidéo 2 aux mouvements de caméra et l’audio 1 au timbre vocal. Cette approche « une référence, une tâche principale » n’est pas une restriction technique, mais une méthode pratique pour réduire l’ambiguïté.
Limites des références MiniMax H3
Les spécifications officielles de H3 comptent aussi lors de la planification d’un flux.
Entrée ou sortie | Limite |
|---|---|
Images de référence | Jusqu’à 9 |
Vidéos de référence | Jusqu’à 3, de 2 à 15 secondes chacun, 15 secondes au total |
Audio de référence | Jusqu’à 3, de 2 à 15 secondes chacun, 15 secondes au total |
Fichiers de référence combinés | Jusqu’à 12 |
Entrée Ref2VA audio seule | Non pris en charge |
Durée de sortie | 4 à 15 secondes |
Fréquence d’images en sortie | 24 FPS |
Audio natif | Stéréo 32 kHz |
La conséquence pratique est simple : le nombre de références disponibles dépasse celui que la plupart des projets devraient réellement utiliser. Commencez par l’ensemble le plus réduit qui définisse clairement le plan.

Comment les références d’image MiniMax H3 contrôlent-elles l’identité et l’apparence ?
Une référence d’image MiniMax H3 convient surtout aux attributs qui doivent rester reconnaissables d’une image à l’autre, notamment le visage, la coiffure, les costumes, la géométrie du produit, les matériaux, l’environnement et le style visuel.
Références de sujet et images d’ancrage dans MiniMax H3
Une référence de sujet représente une personne ou un objet réutilisable. Une image d’ancrage correspond davantage à une composition ou à un état visuel concret.
Utilisez une référence centrée sur le sujet si l’exigence est « conserver ce personnage ou ce produit ». Utilisez un flux centré sur l’image si l’exigence est « commencer ou terminer sur cette image précise ».
Cohérence des personnages et des produits
Pour les personnages, une référence d’identité épurée est généralement plus utile que plusieurs portraits incohérents. Des contradictions de coiffure, d’âge, de vêtements ou de proportions peuvent affaiblir la conservation de l’identité.
Les produits exigent des contraintes encore plus strictes. Un plan cinématographique reste inutilisable si le logo se déplace ou si la silhouette change. Pour un travail de marque, préservez explicitement les proportions, la position du logo, les matériaux, les couleurs et les détails structurels distinctifs.
Comment les références vidéo MiniMax H3 contrôlent-elles le mouvement et la caméra ?
Les références vidéo sont surtout utiles pour les informations qui se déploient dans le temps : mouvements du corps, chorégraphie, interprétation, timing des gestes, trajectoires de caméra, rythme, coupes et rythme du montage.
Transfert d’identité et d’interprétation dans MiniMax H3
L’un des schémas Ref2VA les plus efficaces est le suivant :
L’image A définit qui est le personnage. La vidéo B définit ce qu’il fait.
Un flux de mode peut, par exemple, utiliser une image pour l’identité, une autre pour les vêtements, une vidéo pour la démarche et une seconde pour les mouvements de caméra. Cela sépare l’identité visuelle du mouvement au lieu de demander à un seul prompt d’inventer les deux.
Flux de références de caméra dans MiniMax H3
La vidéo peut aussi définir la caméra plutôt que l’acteur. Une image de produit peut préserver la géométrie, tandis qu’une vidéo sans rapport fournit une orbite lente, un travelling avant, un suivi caméra à l’épaule ou un mouvement de type grue.
Du point de vue du design, cela compte parce que le langage de la caméra fait partie de la direction créative. Le même produit peut paraître haut de gamme, dynamique ou documentaire selon les mouvements du plan.
Pourquoi « mouvement uniquement » peut encore laisser passer l’apparence
« Utiliser cette vidéo uniquement pour le mouvement » est une consigne, pas une frontière d’extraction parfaite. Les vêtements, la morphologie, l’éclairage ou d’autres traits visuels peuvent encore passer depuis la source.
Dans ce cas, la meilleure première correction consiste généralement à simplifier l’ensemble de références, renforcer la source d’identité voulue et restreindre le rôle de la vidéo.
Comment fonctionnent les références audio de MiniMax H3 ?
H3 peut générer conjointement l’audio et la vidéo, faisant du son une composante du système créatif plutôt qu’une simple couche de postproduction.
Les références audio peuvent influencer le timbre vocal, la diction, la musique, le rythme, la structure de la bande-son, les effets sonores et la texture sonore.
Réutilisation et référence audio dans MiniMax H3
Réutiliser l’audio signifie conserver tout ou partie d’un signal existant. Une référence audio consiste à en emprunter les caractéristiques tout en laissant le contenu généré changer.
Cette distinction compte pour de nouveaux dialogues. Si la source doit définir la personne qui parle plutôt que les mots, la direction créative doit privilégier le timbre vocal et la diction, pas simplement réutiliser l’audio original.
Types d’échecs audio de MiniMax H3
Notre analyse des flux H3 documentés a relevé des problèmes récurrents, notamment :
- syllabes répétées
- parole déformée
- dialogue ressemblant à du charabia
- mélange des voix entre personnages
- synchronisation labiale insuffisante
- audio se terminant avant la séquence visuelle
Un flux Spectrum documenté de 20 étapes effectuait 11 évaluations réelles du transformer et prédisait neuf étapes intermédiaires, réduisant le travail de l’échantillonneur d’environ 45 %. Ce même flux produisait aussi un audio plus rugueux et des syllabes répétées.
La leçon pour la production est importante : une optimisation qui préserve des images acceptables peut malgré tout dégrader le dialogue.
MiniMax H3 : choisir FL2VA ou Ref2VA ?
FL2VA et Ref2VA répondent à des problèmes de contrôle différents.
Exigence | Meilleur choix |
|---|---|
Contrôle exact de la première image | FL2VA |
Contrôle exact de la dernière image | FL2VA |
Personnage et mouvement | Ref2VA |
Personnage et caméra | Ref2VA |
Plusieurs images de référence | Ref2VA |
Référence audio | Ref2VA |
Composition multimodale complexe | Ref2VA |
Utilisez FL2VA lorsque l’image elle-même est la contrainte principale. Utilisez Ref2VA lorsque différents attributs doivent provenir de références distinctes.
Quand FL2VA est préférable
FL2VA est souvent le choix le plus simple si vous disposez déjà d’un visuel clé conçu, d’une image de storyboard ou d’un état final imposé. Si le contrôle multiréférence n’apporte aucune valeur créative réelle, Ref2VA peut ajouter une complexité inutile.
Quand Ref2VA est préférable
Ref2VA est plus performant lorsque le plan combine identité, costumes, mouvement, caméra et son issus de sources différentes.
Dans les flux étudiés, la netteté réduite, le grain supplémentaire et la baisse du détail perçu revenaient régulièrement parmi les préoccupations liées à Ref2VA. Ces observations ne constituent pas un benchmark contrôlé à graine identique, mais révèlent un compromis utile : un contrôle plus poussé des références peut coûter en fidélité visuelle perçue.
Comment combiner plusieurs références MiniMax H3 sans conflits ?
Un flux multiréférence fiable commence par trois questions :
Que faut-il conserver à l’identique ? Que faut-il transférer ? Que faut-il ignorer ?
Pour une vidéo de personnage :
- Préserver : visage, coiffure, costumes
- Transférer : chorégraphie, trajectoire de caméra, caractéristiques vocales
- Ignorer : identité de l’interprète source, vêtements indésirables, détails du décor sans rapport
Pour une publicité de produit :
Variable créative | Source |
|---|---|
Géométrie du produit | Image du produit |
Acteur | Image du personnage |
Environnement | Image du lieu |
Caméra | Référence vidéo |
Voix ou carillon | Référence audio |
Timing | Prompt |
Avant le rendu, vérifiez si deux références définissent différemment le même attribut. Supprimer une référence contradictoire améliore souvent le contrôle davantage qu’ajouter du texte au prompt.
Comment rédiger un meilleur prompt de références pour MiniMax H3 ?
Un bon prompt H3 se lit comme un brief de production concis.
Définir les rôles des références et les éléments à préserver
Commencez par indiquer ce que contrôle chaque source, puis fixez les détails qui ne doivent pas changer : visage, coiffure, costumes, forme du produit, logo, couleur ou matériau.
Écrire la scène sous forme de chronologie
Les prompts vidéo doivent décrire quand les actions se produisent. Un plan de 15 secondes peut d’abord installer la scène, introduire ensuite l’interprétation, ajouter plus tard une orbite de caméra et se terminer par un dialogue.
Cela donne à H3 une structure temporelle et à l’équipe créative des points de contrôle clairs pour la revue.
Séparer caméra, son et contraintes négatives
Les instructions de caméra doivent décrire la manière de filmer la scène : orbite, travelling avant, mouvement à main levée, bascule de mise au point ou faible profondeur de champ.
Les instructions sonores doivent définir séparément la personne qui parle, la référence vocale, l’ambiance, la musique et le timing. Les contraintes négatives doivent viser les échecs critiques pour la production : modifier un logo, reprendre le mauvais acteur ou introduire une seconde voix.
L’objectif n’est pas un prompt plus long, mais moins de décisions ambiguës.
Quelles données de performance MiniMax H3 comptent en pratique ?
Notre analyse comprend plusieurs flux locaux. Ce ne sont pas des benchmarks standardisés, mais ils montrent à quelle vitesse le coût des itérations peut augmenter.
Matériel / flux | Résultat rapporté |
|---|---|
RTX 4070 Ti SUPER 16 Go | 640×832 : 1,63 s en 2 min 09 s ; 736×960 : 6,58 s en 6 min 55 s |
RTX 6000 PRO 96 Go | 1K : référence 14 s, EasyCache 8 s ; 2K : référence 37 s, EasyCache 22 s |
Production longue sur RTX 5090 | Environ 10 min pour un clip de 15 s à environ 1,5 MP |
768×1280, 20 étapes | 5 s : 2 min ; 10 s : 6 min ; 20 s : 20 min ; 30 s : 43 min |
La principale leçon pratique est que les générations plus longues peuvent devenir disproportionnellement coûteuses. Réalisez des brouillons peu coûteux pour valider les références, les mouvements, le cadrage et la graine avant de viser la qualité finale.

MiniMax H3 peut-il générer des images fixes ?
H3 a aussi été utilisé dans des flux expérimentaux d’images fixes pour des affiches, des fiches de personnages, des modifications de costumes, de lieux et d’angles de caméra. Un flux documenté RTX 5090 sur RunPod rapportait environ huit secondes pour retoucher une image de 1920×1088.
Il vaut mieux y voir un contournement de workflow qu’un mode image natif officiel.
Comment préserver la cohérence de vidéos MiniMax H3 plus longues ?
La sortie native durant de 4 à 15 secondes, les productions plus longues nécessitent généralement une continuation par segments.
Un flux documenté transmettait environ 22 images précédentes à la génération suivante. Un autre réutilisait les dernières deux à trois secondes de chaque section pour assembler un projet d’environ deux minutes.
Voici un flux pratique pour une production longue :
- Générer un clip court.
- Sélectionner la prise réussie.
- Préserver l’état visuel final.
- Réutiliser les références d’identité et de costumes.
- Générer le segment suivant.
- Assembler les clips réussis.
- Vérifier séparément la continuité de la voix, de l’ambiance et de la musique.
Les fiches de personnages aident aussi à définir face, profil, corps, coiffure, vêtements et accessoires sous plusieurs vues.
Bonnes pratiques des références MiniMax H3
Pour une production fiable, réunissez ces principes dans une liste de contrôle :
- Attribuer une tâche principale à chaque référence.
- Séparer l’identité de l’interprétation.
- Retirer les références concurrentes avant de complexifier le prompt.
- Expliciter le timing et les temps forts de la scène.
- Fixer les attributs essentiels de marque, de produit et d’identité.
- Évaluer l’audio séparément de la qualité visuelle.
- Faire des brouillons peu coûteux, puis consacrer le calcul à la version qui mérite d’être finalisée.
Ces principes sont plus faciles à répéter lorsqu’ils font partie d’un flux MiniMax H3 documenté plutôt que d’être réinventés à chaque génération.
FAQ
Pourquoi Ref2VA paraît-il plus flou que FL2VA ?
Notre analyse a relevé des signalements récurrents de détails plus doux, de grain accru et de netteté perçue réduite dans certains flux Ref2VA. Ce n’est pas un benchmark contrôlé universel. Si vous avez seulement besoin d’un fort contrôle de la première ou de la dernière image, FL2VA peut être plus simple ; utilisez Ref2VA lorsque la souplesse multiréférence est nécessaire.
Dois-je utiliser FL2VA ou Ref2VA ?
Utilisez FL2VA lorsque l’image de départ ou d’arrivée est la contrainte dominante. Utilisez Ref2VA pour combiner identité, vêtements, mouvement, caméra ou audio issus de sources distinctes. Le meilleur mode est celui qui introduit le moins de complexité de contrôle inutile.
H3 peut-il créer des vidéos de plus de 15 secondes ?
Oui, mais les projets longs sont généralement assemblés à partir de plusieurs générations courtes. Les flux pratiques réutilisent les images finales, les secondes précédentes, les références de personnage et une direction sonore cohérente pour réduire les ruptures entre segments.
H3 peut-il générer des images fixes ?
H3 peut servir à générer et retoucher des images fixes par des flux expérimentaux, sans que cela équivaille à un mode image natif officiel. Les usages documentés comprennent les affiches, fiches de personnages, modifications de costumes et changements d’angle de caméra.
Conclusion
MiniMax H3 donne le meilleur de lui-même lorsque les références d’image, de vidéo et d’audio sont traitées comme des sources distinctes de responsabilité créative plutôt que comme un amas de contexte. Les images doivent généralement définir une identité visuelle stable, les vidéos le comportement temporel, l’audio les caractéristiques sonores, et le prompt les interactions entre ces sources. Ref2VA permet un contrôle multimodal plus poussé, mais cette souplesse peut impliquer des compromis de netteté, de fiabilité audio, de cohérence et de coût de calcul. La stratégie la plus solide consiste donc à attribuer un rôle clair à chaque référence, séparer identité et interprétation, fixer les attributs essentiels, structurer les scènes dans le temps, valider l’audio indépendamment et itérer à faible coût avant le rendu final. Pour les équipes qui cherchent où cette approche riche en références est la plus utile, où utiliser MiniMax H3 constitue une prochaine étape pratique.
Plus d’articles du blog Virse
Flux de travail

GPT Image 2.5 Noise and Oversharpening: Why Some Images Still Look AI-Generated
9 octobre 2026 by Yifan Zhao
Flux de travail

GPT Image 2.5 Keeps Changing My Image: How to Use a "Keep List" for Reliable Edits
9 octobre 2026 by Yifan Zhao
Flux de travail

GPT Image 2.5 Editing Drift: Why Images Get Blurry, Cropped or Worse After Multiple Edits
9 octobre 2026 by Yifan Zhao