Audio et vidéo conjoints
Du son généré avec l’image plutôt qu’ajouté ensuite.
Seedance 2.0 de ByteDance produit image et son en une passe à partir d’une première et d’une dernière image ou d’images de référence, de 480P à la 4K native.
Ouvrez cette page sur un navigateur de bureau pour commencer à créer.
Seedance 2.0 est le modèle vidéo de ByteDance, caractérisé par un audio qui ne constitue pas une étape séparée.
La plupart des vidéos générées arrivent sans son puis sont sonorisées, d’où cette impression fréquente d’images simplement recouvertes de musique. Seedance 2.0 génère conjointement audio et vidéo : ambiances, sons de mouvement et rythme sont synchronisés sur l’action réelle à l’écran, pas approximativement ajustés après. Virse propose quatre entrées, distinguant génération par images clés et par références, chacune avec une variante Fast.
Utilisez Seedance 2.0 lorsque le clip doit sonner comme le lieu représenté. Créez des montages publicitaires, mouvements de produits, séquences animées, séries de personnages et vidéos sociales où l’audio fait partie du plan plutôt que d’une décision remise à plus tard.

Seedance 2.0 est un modèle de génération vidéo par IA développé par ByteDance. Il produit des vidéos avec un audio synchronisé à deux canaux, en suivant les instructions écrites sur les sujets, l’action, la caméra, le rythme et le son.
Le modèle repose sur trois atouts majeurs :
Les générations durent quatre à quinze secondes, avec des formats allant de 21:9 à 9:16. Virse propose quatre entrées : Seedance 2.0 et Seedance 2.0 Fast acceptent une première image, une dernière image ou les deux ; Seedance 2.0 Reference et Seedance 2.0 Fast Reference utilisent plutôt des références fournies.

Du son généré avec l’image plutôt qu’ajouté ensuite.
Durée d’une génération en une passe, prolongeable à partir d’un résultat précédent.
Véritable sortie 4K plutôt qu’agrandissement, avec 480P, 720P et 1080P aux niveaux inférieurs.
Images, clips vidéo et audio peuvent être fournis en entrée.
Parcours par images clés et par références, chacun avec une variante Fast.
De 21:9 à 9:16 à partir du même descriptif écrit.
Le son étant généré avec l’image, un pas s’entend quand le pied touche le sol. Cette synchronisation est difficile à obtenir en sonorisant ensuite un clip silencieux : c’est la principale raison de choisir un modèle conjoint.
La plupart des modèles vidéo acceptent des images. Celui-ci accepte aussi des clips et de l’audio comme références : caractère du mouvement et texture sonore peuvent être montrés plutôt que décrits.
Les quatre entrées se distinguent clairement. Fournissez des images clés si vous connaissez le début et la fin du plan ; des références si un sujet doit rester reconnaissable et est plus facile à montrer qu’à décrire.
Le 480P permet de tester rythme et mouvement sans consommer le budget du montage final. Le descriptif ne change pas quand vous montez en résolution.
Seedance 2.0 Fast et Fast Reference couvrent les petites tailles à coût réduit, adaptées aux phases d’exploration.
Le modèle traite les mouvements de dessin animé 2D, les séquences animées 3D et les styles illustrés aussi facilement que les images de style prise de vue réelle.
La vidéo guidée par références exige que celles-ci existent d’abord, et elles arrivent rarement sous forme d’un ensemble ordonné. Un personnage vient d’un endroit, une photo produit d’un autre, une référence de mouvement d’un troisième. Virse réunit ces éléments là où la vidéo est créée. Les images produites par n’importe quel modèle d’image sur le canevas passent directement à Seedance 2.0 comme références ou images clés, sans export ni réimport intermédiaires.
Générez des images de personnages et de produits avec un modèle d’image, puis utilisez-les directement dans Seedance 2.0.
Fixez le rythme et le mouvement en 480P, puis relancez le même descriptif en 1080P ou 4K.
Passez de Seedance 2.0 à plus de 30 autres modèles d’image et de vidéo sans quitter le canevas ni réécrire le descriptif.
Réutilisez les mêmes références pour chaque clip d’une séquence afin de préserver la cohérence de l’ensemble.
Courtes séquences de marque dont le fond sonore est généré avec l’image.
Rotations, révélations et passages sur les détails commençant et finissant sur des compositions définies.
Séquences illustrées et animées conservant un style cohérent entre les plans.
Suite de clips où un interprète reste reconnaissable d’un plan à l’autre.
Montages verticaux et paysage ébauchés en 480P et finalisés en 1080P.
Storyboards transformés en références animées avant toute mise en production.
Images clés pour les compositions définies, références pour la continuité, Fast pour l’exploration.
Importez les images d’ouverture et de fin ou les références, et précisez l’apport de chacune.
Décrivez ce qui bouge, le comportement de caméra et le son du clip.
Passez le descriptif validé en 1080P ou 4K sans en changer un mot.
Un prompt Seedance 2.0 utile comprend généralement six éléments :
Au lieu d’écrire
Une vidéo produit de montre, cinématographique.
Écrivez
Ouvrez sur le cadran de montre de l’image 1 remplissant le cadre sous une seule lumière zénithale dure. Tournez lentement dans le sens horaire autour du boîtier tandis que les reflets parcourent la lunette polie. À mi-parcours, reculez pour révéler la montre entière sur une pierre sombre. Terminez sur la composition de l’image 2. Mouvement continu sans coupe. Ambiance de pièce calme tout au long du clip, avec une note métallique grave lorsque la caméra s’immobilise.
Commencez sur le flacon de parfum fermé de l’image 1, centré sur un fond bordeaux profond. Avancez lentement pendant le premier tiers du clip tandis que la lumière glisse sur le verre. Soulevez le bouchon d’un geste continu en gardant le flacon immobile et la caméra stable. Terminez sur la composition de l’image 2, bouchon suspendu au-dessus du flacon. Faible ambiance de pièce et un tintement de verre doux au moment où le bouchon se soulève.
Animez le personnage de l’image 1 dans le style illustré de l’image 2. Le personnage entre par la gauche dans une clairière peinte à la main, s’arrête au centre et lève les yeux quand la lumière perce la canopée. Préservez le trait, la palette et les proportions des références tout au long du plan. Caméra fixe. Ambiance forestière en plusieurs couches avec chants d’oiseaux et légère phrase musicale ascendante quand le personnage lève les yeux.
Utilisez le mannequin de l’image 1, la veste de l’image 2 et le toit de l’image 3. Commencez en plan moyen lorsque le mannequin se tourne vers la caméra, puis effectuez un lent travelling vers la droite tandis que l’horizon urbain apparaît derrière. Préservez le visage ainsi que la coupe, la couleur et la texture de la veste selon les références. Lumière de ciel couvert. Vent, circulation lointaine et fond électronique discret.
| Critère | Seedance 2.0 | Seedance 2.5 |
|---|---|---|
| Durée du clip | Quatre à quinze secondes | Jusqu’à trente secondes |
| Références en entrée | Images, vidéo et audio | Ensemble de références multimodales élargi |
| Continuité narrative | Plans uniques et séquences courtes | Prolongements successifs pour des récits plus longs |
| Contrôle des retouches | Par prompt sur l’ensemble du clip | Par horodatage sur des moments précis |
| Entrées dans Virse | Quatre, distinguant images clés et références | Une |
| Où il s’inscrit | Plans définis à la taille choisie | Récits structurés plus longs |
Avec un modèle conjoint, ne rien dire du son n’est pas neutre : le modèle décide. Précisez le mixage, même simple.
Contraindre la composition finale élimine la plupart des dérives d’un plan devant aboutir à un endroit précis.
Préciser l’apport de chaque image, clip ou fichier audio empêche le modèle d’en moyenner les influences.
Fixez cadrage, rythme et mouvements de caméra à la plus petite taille et ne dépensez le budget de livraison qu’une fois.
Réunissez l’image d’ouverture, les références et les instructions sonores dans un même espace, et laissez le modèle gérer ensemble mouvement et mixage.