Nativement multimodal
Texte, images, vidéo et audio acceptés dans une seule interface.
Le modèle vidéo nativement multimodal de Google accepte texte, images, vidéo et audio, et propose dans Virse des entrées guidées par images clés ou par références.
Ouvrez cette page sur un navigateur de bureau pour commencer à créer.
Gemini Omni Flash est le modèle vidéo rapide de Google, annoncé en juin 2026. Pour le comprendre, il faut regarder ce qu’il accepte en entrée.
La plupart des modèles vidéo prennent une image et un paragraphe. Celui-ci est nativement multimodal : texte, images, vidéo et audio passent par une même interface plutôt que par des adaptateurs distincts ajoutés après coup. C’est une propriété architecturale, pas une liste de fonctions, qui se manifeste dans la cohérence avec laquelle il concilie des entrées divergentes. Google l’a aussi conçu pour l’affinement conversationnel : on ajuste un clip en poursuivant l’échange plutôt qu’en réécrivant le descriptif.
Utilisez Gemini Omni Flash lorsque vos entrées sont variées et que votre chaîne d’image repose déjà sur Google. Animez des images Nano Banana ou Gemini, guidez les plans par des références et améliorez un clip en lui répondant.

Gemini Omni Flash est un modèle de génération vidéo par IA développé par Google DeepMind, dans la gamme Gemini Flash qui privilégie la rapidité de réponse. Il a été annoncé en juin 2026 comme une option économique de génération et de montage vidéo conversationnel.
Le modèle repose sur trois atouts majeurs :
Virse propose deux entrées. Gemini Omni Flash accepte une première image, une dernière image ou les deux, avec un descriptif écrit. Gemini Omni Flash Reference utilise plutôt des images d’exemple fournies. L’entrée proposée dans Virse est la configuration 720P, qui produit un audio natif à chaque génération : les instructions audio ne font donc pas partie du descriptif ici.

Texte, images, vidéo et audio acceptés dans une seule interface.
Guidage par images clés et par références, proposés séparément dans Virse.

La taille proposée dans Virse. L’audio est généré nativement avec l’image.
Un modèle de la gamme Flash, dont la vitesse compte encore plus en vidéo qu’en image fixe.
Ajustez un résultat en poursuivant l’instruction plutôt qu’en la réécrivant.
Un signal imperceptible intégré à chaque clip généré.

La multimodalité native signifie que texte, images, vidéo et audio sont traités par le même modèle plutôt que par des encodeurs distincts. Des entrées qui entreraient en conflit dans un système assemblé sont ici conciliées.

Veo 3.1, le modèle vidéo plus lourd de Google, est guidé par images clés. Gemini Omni Flash ajoute un parcours par images de référence, seul moyen d’obtenir ce type de contrôle de continuité dans la famille Google.

Plutôt que de réécrire un descriptif pour corriger un détail, le modèle permet des ajustements itératifs : le premier résultat est conçu comme un point de départ.

La gamme Flash privilégie la rapidité. En vidéo, où une génération lente brise entièrement la concentration, cela compte encore davantage qu’en image fixe.

Les images de Nano Banana Pro, Nano Banana 2 ou Gemini 2.5 Flash Image proviennent de la même famille, ce qui préserve le caractère visuel lors du passage au mouvement.

SynthID s’intègre automatiquement à chaque clip et l’identifie comme généré par IA, sans marque visible ni option à activer.
Rester dans une même famille de modèles tout au long du processus semble une préférence, jusqu’au jour où changer de fournisseur en cours de projet vous coûte un après-midi à comprendre pourquoi la version animée diffère de l’image fixe. Virse facilite le parcours au sein d’une même famille. Une image créée par un modèle d’image Google sur le canevas passe directement à Gemini Omni Flash sans export : la transition du fixe au mouvement se fait sur place.
Envoyez une image Nano Banana ou Gemini directement au modèle vidéo sur le même canevas.

Chaque affinement reste près de la version dont il provient : le parcours conversationnel peut ainsi être revu après coup.

Passez de Gemini Omni Flash à plus de 30 autres modèles d’image et de vidéo sans quitter le canevas ni réécrire le descriptif.

Testez la même image avec Veo 3.1 juste à côté pour savoir si sa lourdeur supplémentaire en vaut la peine.


Du mouvement ajouté aux images générées ailleurs dans la famille Google.

Plans dont le sujet est défini par des exemples visuels plutôt que décrit.

Clips rapides où le délai compte davantage que la résolution.

Révélations et rotations simples à partir d’une image d’ouverture définie.

Référence animée d’une idée de plan avant tout engagement.

Clips affinés en plusieurs passes plutôt que parfaitement spécifiés d’avance.
Avec des images clés, utilisez l’entrée standard. Pour maintenir un sujet entre plusieurs clips, utilisez Reference.
Ajoutez les compositions ou l’ensemble d’exemples, en précisant le rôle de chaque image.
Décrivez les mouvements de la scène, le comportement de caméra et le rythme. L’audio est rendu avec l’image : les indications de dialogue et d’ambiance méritent donc d’être incluses.
Ajustez le résultat avec une instruction de suivi plutôt que de réécrire le descriptif initial.
Un prompt Gemini Omni Flash utile comprend généralement quatre éléments :
Au lieu d’écrire
Une personne ouvre une fenêtre, joli mouvement naturel, cinématographique.
Écrivez
Une personne se tient devant une fenêtre à guillotine, les deux mains sur le cadre inférieur, vue de dos à hauteur de taille. Elle pousse la fenêtre vers le haut d’un geste fluide jusqu’à ouverture complète, puis baisse les mains. La caméra reste fixe, sans rapprochement ni travelling. Terminez avec la fenêtre ouverte et les bras le long du corps.

Commencez sur l’image 1 : une tasse de thé sur un rebord de fenêtre, vapeur montante, rideau immobile. Une brise soulève le rideau par la droite pendant la première moitié du clip, puis il retombe. La vapeur monte sans interruption. La caméra tient un gros plan fixe, sans mouvement ni coupe. Terminez sur l’image 2 : rideau retombé, tasse inchangée.

Utilisez la personne de l’image 1, le tablier de l’image 2 et le comptoir de boulangerie de l’image 3. Il pose un plateau de pains sur le comptoir, se redresse et s’essuie les mains sur le tablier. Plan moyen fixe depuis le côté client du comptoir, caméra immobile. Préservez exactement son visage, ses cheveux ainsi que la couleur et la coupe du tablier. Terminez avec ses mains le long du corps.

Un vélo appuyé contre un mur de briques peintes, vu de face. Rien ne bouge dans la scène. La caméra effectue un travelling lent vers la gauche à vitesse constante, garde le vélo dans le cadre et dévoile une entrée à sa droite. Lumière homogène de ciel couvert tout au long du plan. Terminez avec le vélo au bord droit et l’entrée au centre.
| Critère | Gemini Omni Flash | Veo 3.1 |
|---|---|---|
| Types d’entrée | Texte, images, vidéo et audio | Texte et images clés |
| Entrée par références | Oui, proposée séparément | Non |
| Sortie dans Virse | 720P, sans son | 720p à 4K, audio facultatif |
| Objectif de conception | Rapidité de réponse | Plafond de sortie |
| Construction de séquences | Affinement conversationnel | Extension de scène |
| À choisir lorsque | Les entrées sont variées ou un sujet doit persister | Le projet exige de la durée, de l’audio ou de la 4K |
Donnez au mouvement un début et une fin clairs plutôt qu’une description ouverte.
Dans l’entrée Reference, précisez quelle image fournit le sujet et laquelle fournit le décor.
Les images Nano Banana ou Gemini 2.5 Flash Image passent à ce modèle sans changement de caractère visuel.
Le modèle est conçu pour les instructions de suivi. Réécrire tout le descriptif fait perdre ce qui fonctionnait déjà.
Animez les images déjà produites par vos modèles Google ou guidez le plan à partir de références, dans les deux cas sans quitter le canevas.