2K en standard
Pas un niveau premium : chaque génération sort en 2K.
Le modèle Hailuo 03 de MiniMax produit des vidéos 2K sans son, guidées par une première et une dernière image ou par un ensemble d’images de référence.
Ouvrez cette page sur un navigateur de bureau pour commencer à créer.
Minimax H3 est le modèle vidéo de MiniMax. Sa place dans Virse est particulièrement simple à décrire : il produit de la 2K, ne produit aucun son et ne demande aucun autre choix.
La plupart des modèles vidéo présentent une grille — résolution, format, qualité — où chaque choix retarde un peu le démarrage. Celui-ci n’a qu’une configuration. Chaque génération sort en 2K avec un audio natif, y compris des dialogues synchronisés aux lèvres : le clip arrive sonorisé sans attendre une passe dédiée.
Utilisez Minimax H3 lorsque la résolution est requise et que l’audio ne l’est pas. Produisez des mouvements de produits riches en détails, des séries de personnages guidées par références et des séquences destinées à un montage dont le son est traité séparément.

Minimax H3 est un modèle de génération vidéo par IA développé par MiniMax, connu côté infrastructure sous le nom Hailuo 03. Virse le propose sous deux entrées aux données différentes mais au même résultat.
Le modèle repose sur trois atouts majeurs :
Minimax H3 accepte une première image, une dernière image ou les deux, avec un descriptif écrit. Minimax H3 Reference utilise plutôt des images de référence, dont il reprend les sujets, le style et le langage visuel dans une séquence générée. Les deux produisent de la 2K avec un audio natif.
Pas un niveau premium : chaque génération sort en 2K.
Une piste audio générée accompagne chaque clip, sans option pour la désactiver.
Guidage par images clés et par références, proposés séparément.
Ni sélecteur de résolution ni niveau de qualité. L’audio est toujours activé, pas facultatif.
L’entrée Reference utilise les images fournies comme guide.
L’entrée standard fixe l’une des extrémités du plan, ou les deux.
La 2K est la résolution de ce modèle. Aucun niveau à comparer ni passage supérieur à envisager : cela supprime la cause d’hésitation la plus courante avant de générer.
Synchronisation labiale et ambiance sont produites dans la même passe que l’image. C’est le fonctionnement par défaut, pas un réglage à penser à activer.
Si un personnage doit rester reconnaissable dans six clips, montrer des exemples au modèle fonctionne mieux que le décrire. L’entrée Reference existe précisément pour cela.
Plusieurs images peuvent avoir chacune leur rôle — personne, décor, style — au lieu de se fondre en une influence unique.
L’entrée standard accepte une première et une dernière image : la génération relie deux compositions connues plutôt que de suivre une trajectoire ouverte.
Choisir entre guidage par images clés et par références dépend de ce dont vous disposez, pas de votre budget.
La continuité guidée par références dépend de la stabilité de l’ensemble de références. Changez une image entre deux clips et le personnage évolue, souvent sans que personne le remarque avant l’assemblage de la séquence. Virse garde cet ensemble au même endroit. Les références vivent sur le canevas près de tous les clips qu’elles ont générés : les mêmes données sont réutilisées plutôt que rassemblées à nouveau, et les dérives deviennent visibles quand il reste encore du temps pour les corriger.
Gardez ensemble sur le canevas les images de personnages, de produits et de style, et utilisez les mêmes pour chaque clip.

Créez les images fixes avec un modèle d’image sur le même canevas, puis transmettez-les à Minimax H3 sans export.

Passez de Minimax H3 à plus de 30 autres modèles d’image et de vidéo sans quitter le canevas ni réécrire le descriptif.

Disposez les clips dans l’ordre pour rendre évidente toute dérive d’un sujet entre le deuxième et le cinquième plan.

Plusieurs clips avec la même personne, reliés par un ensemble de références commun.
Rotations, révélations et passages sur les détails à une résolution qui résiste au recadrage.
Références de vêtements et de style guidant le mouvement sans devoir les redécrire chaque fois.
Clips stylisés dont le langage visuel défini doit se maintenir d’un plan à l’autre.
Clips guidés par images clés dont la composition est déjà décidée.
Séquences pour des montages où dialogues et ambiances générés sont un point de départ plutôt qu’un ajout ultérieur.
Guidage par images clés si la composition est connue, par références si un sujet doit rester reconnaissable.
Chargez les deux images d’extrémité ou l’ensemble de références en précisant le rôle de chacune.
Décrivez ce qui bouge dans la scène, le comportement de caméra et le rythme.
Gardez les mêmes entrées et ne changez que le descriptif pour préserver la cohérence de la série.
Un prompt Minimax H3 utile comprend généralement quatre éléments :
Au lieu d’écrire
Un mannequin marche dans une galerie, style cinématographique, à partir des références jointes.
Écrivez
Utilisez la personne de l’image 1, le manteau de l’image 2 et l’intérieur de galerie de l’image 3. Elle marche sans hâte du bord gauche vers le centre du cadre et s’arrête face à un tableau hors champ à droite. La caméra la suit à distance constante, en conservant sa taille dans le cadre. Terminez avec elle immobile, de profil, au centre du cadre.
Utilisez la femme de l’image 1 et l’intérieur de l’atelier de l’image 2. Elle est assise à un établi et travaille de ses mains sur un objet hors cadre. Elle s’arrête, lève les yeux vers la fenêtre à gauche, puis revient à ses mains. La caméra tient un plan moyen fixe légèrement au-dessus de l’établi, sans mouvement ni coupe. Préservez exactement son visage, ses cheveux et ses vêtements tels qu’ils apparaissent sur l’image 1. Terminez avec sa tête de nouveau baissée.
Ouvrez sur la composition de l’image 1 : une sacoche en cuir debout sur une tablette de pierre pâle, boucles face à la caméra. La caméra décrit lentement un arc d’environ quarante-cinq degrés vers la gauche, en gardant la sacoche centrée et de taille constante. La lumière reste fixe pendant le mouvement : les reflets parcourent le cuir et les pièces métalliques. Terminez sur une vue de trois quarts montrant le soufflet latéral et les coutures.
Commencez sur l’image 1 : une scène vide avec un seul pied de micro, éclairage de salle allumé. L’éclairage de salle baisse pendant la première moitié du clip tandis qu’un unique projecteur zénithal s’allume sur le micro. Rien d’autre ne bouge. La caméra garde un plan large fixe tout au long du clip. Terminez sur l’image 2 : la scène dans l’obscurité, sauf le micro éclairé.
| Critère | Minimax H3 | Minimax H3 Reference |
|---|---|---|
| Entrée | Première image, dernière image ou les deux | Images de référence fournies |
| Sortie | 2K sans son | 2K sans son |
| Idéal pour | Plans à composition définie | Sujets devant rester reconnaissables |
| Contrôle des extrémités | Les deux extrémités peuvent être fixées | Guidage par références plutôt que par images clés |
| Utilisation typique | Mouvements de produits, transitions | Séries de personnages, campagnes stylisées |
| Coût du changement | Même structure de descriptif pour les deux | Même structure de descriptif pour les deux |
Importer trois images sans préciser laquelle fournit le sujet est la cause d’échec la plus courante de ces descriptifs.
Changer une seule image entre les clips suffit à rompre la continuité. Modifiez plutôt le descriptif.
Le résultat contient du son. Les indications de dialogue, d’effets et d’ambiance du prompt façonnent ce qui est généré.
L’entrée standard excelle dans les plans reliant deux états définis.
Choisissez l’entrée correspondant à vos données, décrivez le mouvement et obtenez de la 2K sans écran de configuration intermédiaire.