Áudio e vídeo em conjunto
Som gerado com a imagem, em vez de acrescentado depois.
Seedance 2.0 da ByteDance produz imagem e som numa passagem, a partir de um primeiro e último fotograma ou de imagens de referência, em tamanhos de 480P a 4K nativo.
Abra esta página em um navegador de desktop para começar a criar.
Seedance 2.0 é o modelo de vídeo da ByteDance, e a sua propriedade distintiva é o áudio não ser uma etapa separada.
A maioria do vídeo gerado chega sem som e recebe música depois, razão pela qual muito dele parece vídeo com música colocada por cima. Seedance 2.0 gera áudio e vídeo em conjunto, pelo que o ambiente, os sons do movimento e o ritmo são sincronizados com o que realmente acontece no ecrã, em vez de ajustados de forma aproximada mais tarde. A Virse disponibiliza o modelo em quatro opções, separando a geração orientada por fotogramas da geração orientada por referências e oferecendo uma variante Fast de cada uma.
Use Seedance 2.0 quando o clipe tem de soar como o lugar que representa. Crie montagens publicitárias, movimento de produto, sequências animadas, séries centradas em personagens e vídeo para redes sociais em que o áudio faz parte do plano, em vez de ser uma decisão adiada.

Seedance 2.0 é um modelo de geração de vídeo com IA desenvolvido pela ByteDance. Gera vídeo com áudio sincronizado de dois canais, seguindo instruções escritas sobre sujeitos, ação, comportamento da câmara, ritmo e som.
O modelo assenta em três grandes pontos fortes:
As gerações duram de quatro a quinze segundos, com proporções de 21:9 a 9:16. A Virse apresenta quatro opções: Seedance 2.0 e Seedance 2.0 Fast recebem um primeiro fotograma, um último fotograma ou ambos, enquanto Seedance 2.0 Reference e Seedance 2.0 Fast Reference trabalham antes a partir de material de referência fornecido.

Som gerado com a imagem, em vez de acrescentado depois.
Duração de geração numa única passagem, extensível continuando a partir de um resultado anterior.
Resultado 4K verdadeiro, em vez de uma ampliação, com 480P, 720P e 1080P abaixo.
Imagens, clipes de vídeo e áudio podem ser fornecidos como entrada.
Percursos orientados por fotogramas e por referências, cada um com uma variante Fast.
De 21:9 a 9:16 a partir do mesmo briefing escrito.
Como o som é gerado juntamente com a imagem, um passo soa quando o pé toca no chão. Essa sincronização é difícil de conseguir adicionando som posteriormente a um clipe sem áudio e é a principal razão para escolher um modelo conjunto.
A maioria dos modelos de vídeo aceita imagens. Este também recebe clipes de vídeo e áudio como material de referência, permitindo mostrar o caráter do movimento e a textura sonora, em vez de os descrever.
As quatro opções dividem-se claramente. Forneça fotogramas quando sabe com o que o plano começa e acaba; forneça referências quando um sujeito tem de permanecer reconhecível e descrevê-lo é mais difícil do que mostrá-lo.
480P existe para que testar ritmo e movimento não consuma o orçamento da montagem final. O briefing não muda quando sobe de nível.
Seedance 2.0 Fast e Fast Reference cobrem os tamanhos inferiores a custo reduzido, onde pertencem as rondas exploratórias.
O modelo lida com movimento de desenhos animados 2D, sequências animadas 3D e tratamentos ilustrados com a mesma facilidade que vídeo de estilo de imagem real.
O vídeo orientado por referências precisa de que as referências existam primeiro, e raramente chegam como um conjunto organizado. Uma personagem vem de um lugar, uma fotografia de produto de outro, uma referência de movimento de um terceiro. A Virse reúne esse material no mesmo espaço onde o vídeo é feito. As imagens fixas geradas por qualquer modelo de imagem na tela podem passar diretamente para Seedance 2.0 como referências ou fotogramas, sem exportação e novo carregamento pelo meio.
Gere imagens fixas de personagens e produtos com um modelo de imagem e depois aponte Seedance 2.0 diretamente para elas.
Defina o ritmo e o movimento em 480P e depois execute novamente o briefing idêntico em 1080P ou 4K.
Alterne entre Seedance 2.0 e mais de 30 outros modelos de imagem e vídeo sem sair da tela nem reescrever o briefing.
Reutilize o mesmo conjunto de referências em todos os clipes de uma sequência para manter a consistência do conjunto.
Sequências curtas de marca em que a base de áudio é gerada com a imagem.
Rotações, revelações e passagens de detalhe que começam e acabam em composições definidas.
Sequências ilustradas e animadas que mantêm um aspeto consistente entre planos.
Uma série de clipes em que um intérprete permanece reconhecível de plano para plano.
Montagens verticais e horizontais rascunhadas em 480P e finalizadas em 1080P.
Storyboards transformados em referência em movimento antes de algo entrar em produção.
Orientação por fotogramas para composições definidas, por referências para continuidade, Fast para exploração.
Carregue os fotogramas inicial e final ou o material de referência e diga o contributo de cada um.
Descreva o que se move, como a câmara se comporta e como deve soar o clipe.
Leve o briefing aprovado para 1080P ou 4K sem alterar uma palavra.
Um prompt útil para Seedance 2.0 costuma incluir seis elementos:
Em vez de escrever
Um vídeo de produto de um relógio, cinematográfico.
Escreva
Abra com o mostrador do relógio apresentado na Imagem 1 a preencher o enquadramento sob uma única luz superior dura. Rode lentamente no sentido dos ponteiros do relógio em torno da caixa, enquanto os reflexos percorrem a luneta polida. A meio, afaste-se para revelar o relógio completo assente em pedra escura. Termine na composição da Imagem 2. Mantenha o movimento contínuo, sem cortes. Som ambiente de sala discreto durante todo o clipe, com um tom metálico grave quando a câmara para.
Comece com o frasco de perfume fechado mostrado na Imagem 1, centrado sobre um fundo bordô profundo. Aproxime lentamente durante o primeiro terço do clipe enquanto a luz se desloca pelo vidro. Levante a tampa num movimento contínuo, mantendo o frasco imóvel e a câmara estável. Termine na composição da Imagem 2, com a tampa suspensa por cima do frasco. Ambiente de sala ténue e um único tilintar suave de vidro no momento em que a tampa se levanta.
Anime a personagem da Imagem 1 no estilo ilustrado da Imagem 2. A personagem entra pela esquerda de uma clareira de floresta pintada à mão, para no centro e olha para cima quando a luz atravessa a copa das árvores. Mantenha o traço, a paleta de cores e as proporções das referências durante todo o clipe. Câmara fixa. Ambiente de floresta em camadas com canto de pássaros e uma frase musical ligeira e ascendente quando a personagem olha para cima.
Use o modelo da Imagem 1, o casaco da Imagem 2 e o local no terraço da Imagem 3. Comece num plano médio enquanto o modelo se vira para a câmara e depois desloque-se lentamente para a direita enquanto o horizonte da cidade entra no enquadramento atrás dele. Mantenha o rosto e o corte, a cor e a textura do casaco conforme mostram as referências. Luz natural de céu encoberto. Vento, trânsito distante e uma base eletrónica discreta por baixo.
| Dimensão | Seedance 2.0 | Seedance 2.5 |
|---|---|---|
| Duração do clipe | Quatro a quinze segundos | Até trinta segundos |
| Entradas de referência | Imagens, vídeo e áudio | Conjunto de referências multimodais mais amplo |
| Continuidade da história | Planos isolados e sequências curtas | Extensão em várias rondas para narrativas mais longas |
| Controlo de edição | Ao nível do prompt ao longo do clipe | Ao nível da marca temporal em momentos específicos |
| Opções na Virse | Quatro, separando fotogramas de referências | Uma |
| Onde se enquadra | Planos definidos num tamanho escolhido | Narrativas estruturadas mais longas |
Num modelo conjunto, não falar do som não é neutro: significa que o modelo decide. Indique a mistura mesmo quando é simples.
Restringir a composição final elimina a maioria dos desvios de um plano que tem de terminar num ponto específico.
Indicar o contributo de cada imagem, clipe ou ficheiro de áudio é o que impede o modelo de os diluir numa média.
Defina enquadramento, ritmo e movimento de câmara no tamanho mais baixo e gaste o orçamento de entrega uma única vez.
Reúna o fotograma inicial, as referências e a direção de som num só espaço de trabalho e deixe o modelo tratar do movimento e da mistura em conjunto.