Guía de referencias de Seedance 2.5: cómo usar imágenes, vídeo y audio
Vincent14 min de lectura ·

Seedance 2.5 funciona mejor cuando las imágenes controlan identidad y apariencia, el vídeo controla movimiento y cámara, y el audio controla voz y ritmo. El objetivo no es usar más referencias, sino dar a cada referencia una función clara para controlar mejor personajes, productos, entornos y acciones. Este principio es fundamental para usar Seedance 2.5 y crear un flujo repetible de Seedance 2.5.
Los problemas empiezan cuando esos controles se solapan. Imágenes de personajes contradictorias, guiones gráficos incoherentes o entradas audiovisuales sobrecargadas pueden provocar deriva de identidad, errores de continuidad, reintentos innecesarios y mayores costes de producción. La solución es sencilla: decide exactamente qué debe controlar cada referencia de imagen, vídeo y audio antes de generar. Una guía estructurada de prompts de Seedance 2.5 y una planificación deliberada de referencias facilitan definir esas responsabilidades.
Para los equipos que gestionan trabajo creativo con muchas referencias, Virse integra la IA en el proceso de diseño en lugar de reducirla a un prompt de chat. Su lienzo infinito, colaboración multiagente, contexto compartido del proyecto y memoria de equipo a largo plazo ayudan a organizar referencias, coordinar tareas creativas paralelas y conservar conocimientos de marca y flujo entre proyectos. Este enfoque también favorece flujos creativos más amplios con agentes de diseño de IA y un flujo de diseño con IA más estructurado, del encargo a la entrega.
Seedance 2.5, Seedance 2.0 y MiniMax H3 ya están disponibles en Virse, para que los equipos exploren y comparen varios modelos de vídeo líderes en el mismo flujo creativo.

¿Qué es Seedance 2.5 R2V y cómo funciona?
Seedance 2.5 R2V es un flujo de vídeo multimodal que usa imágenes, vídeos y audio como referencias junto al texto. En vez de describir cada decisión visual y temporal en un prompt, los creadores pueden asignarlas a recursos de origen específicos.
El lanzamiento oficial de Seedance 2.5 de ByteDance confirma vídeos de hasta 30 segundos, con hasta 30 imágenes, 10 clips de vídeo y 10 de audio en una sola pasada. Estas entradas multimodales más amplias son una parte importante del flujo de referencias de Seedance 2.5.

¿Qué deben controlar las referencias de imagen, vídeo y audio?
Referencia | Mejor uso | Riesgo principal |
Imagen | Identidad, productos, vestuario, entornos y estados visuales clave | Señales de apariencia contradictorias |
Vídeo | Movimiento, posiciones en escena, tiempos y movimiento de cámara | Copiar sujetos o fondos no deseados |
Audio | Dirección de voz, diálogo, ritmo, música e indicaciones sonoras | Suponer que el audio original está bloqueado |
Guion gráfico | Composición, secuencia y estados de escena | Errores internos de continuidad |
Clip anterior | Continuación y estado del movimiento | Repetir acciones ya completadas |
El prompt debe funcionar como una capa de asignación, explicando qué referencia controla cada propiedad y qué no debe transferirse. Una guía estructurada de prompts de Seedance 2.5 ayuda a aclarar estas asignaciones antes de generar.
¿Cómo evitar conflictos de referencias en Seedance 2.5?
La regla más útil es sencilla: una referencia, una responsabilidad principal.
Crea un mapa de referencias antes del prompt
Un vídeo comercial puede usar una imagen para la identidad del personaje, otra para el producto, otra para el entorno, un vídeo para el movimiento de cámara y un archivo de audio para el diálogo.
Esto es más controlable que pedir a varias referencias que definan el mismo sujeto.
En las referencias de vídeo, indica también qué no debe atribuirse. Si un clip fuente solo sirve para el movimiento de cámara, su actor, ropa y ubicación no deben convertirse en instrucciones visuales.
Desde la perspectiva de un sistema de diseño, identidad, entorno, movimiento y sonido deberían mantenerse modulares siempre que sea posible.
Elimina los conflictos antes de añadir más instrucciones
Un prompt más largo no siempre resuelve referencias contradictorias. Cuando falle una generación, clasifica primero el problema:
- identidad
- fidelidad del producto
- entorno
- movimiento
- cámara
- audio
- tiempos
- continuidad
Después revisa solo las referencias responsables de ese atributo. Eliminar una fuente conflictiva puede ser más eficaz que añadir otro párrafo de instrucciones.
¿Cuántas referencias debes usar en Seedance 2.5?
Seedance 2.5 tiene una gran capacidad oficial de referencias, pero la capacidad máxima no equivale al conjunto de trabajo óptimo.
Empieza con el conjunto mínimo viable de referencias
Para un plano sencillo, empieza con el mínimo de recursos que aporten información única. Puede bastar con referencias de personaje, producto, entorno y movimiento.
Genera una vez, identifica qué sigue sin control y añade otra referencia solo si resuelve una variable concreta que falta.
Así es más fácil diagnosticar los fallos y se reduce la competencia innecesaria entre entradas.
Qué revela un flujo de cinco personajes sobre la sobrecarga de referencias
Un flujo documentado de varios personajes usó cinco personajes, cinco referencias de audio y hasta 14 referencias visuales. Unas 11 referencias visuales ofrecían un equilibrio más manejable; al acercarse a 14, aumentaba la confusión visual y vocal.

La misma comparación de producción informó aproximadamente de 5–10 generaciones por secuencia con Seedance 2.0 frente a 2–5 con Seedance 2.5.
Para equipos profesionales, el mejor KPI no es el número de referencias, sino las tomas utilizables por generación.

¿Cómo usar las referencias de imagen en Seedance 2.5?
Las referencias de imagen son más fuertes para propiedades que deben mantenerse visualmente estables entre movimientos y planos.
Separa las referencias de personaje, producto y entorno
Para personajes, prioriza rostro, cabello, silueta, vestuario y accesorios distintivos. Para productos, geometría, proporciones, embalaje, etiquetas y materiales. Para entornos, céntrate en arquitectura, iluminación y atmósfera espacial.
Separar estas funciones también facilita iterar: el mismo producto puede pasar de un entorno a otro sin reconstruir todo el sistema de referencias visuales.
Revisa la continuidad del guion gráfico antes de generar
Un flujo con guion gráfico de 16 viñetas revisado expuso una limitación importante. Las posiciones de objetos y estados de escena incoherentes provocaron muebles que desaparecían, sujetos inesperados al fondo y objetos que cambiaban de lugar.
Tras reconstruir el guion gráfico con mayor continuidad espacial, la mayoría de los problemas mejoraron.
La lección es contraintuitiva: una mayor fidelidad a las referencias puede hacer más visible un diseño de referencias deficiente. Antes de generar, comprueba en cada viñeta los objetos persistentes, muebles, personajes, dirección en pantalla y relaciones espaciales.
¿Cómo usar las referencias de vídeo en Seedance 2.5?
Lo mejor es entender las referencias de vídeo como guías de movimiento y cámara, no captura de movimiento exacta fotograma a fotograma.
Usa vídeo para movimiento, posiciones en escena y lenguaje de cámara
El vídeo puede comunicar recorridos, coreografías, órbitas de cámara, movimiento cámara en mano, ritmo y posiciones en escena con más eficiencia que el texto.
ByteDance también muestra referencias de renderizado de arcilla que separan movimiento de cámara, trayectoria del sujeto y planificación espacial de los materiales e iluminación finales. Esto ayuda en flujos profesionales porque la previsualización puede controlar el movimiento mientras las referencias de imagen controlan la apariencia final.
Los fondos limpios, las interpretaciones con pantalla verde y la previsualización simplificada reducen aún más las señales no deseadas.
Sustituir actores sigue implicando compromisos
En un flujo de vídeo de acción revisado, Seedance 2.5 cambió con éxito ropa y cabello, pero la sustitución facial siguió siendo inestable. Seedance 2.0 manejó mejor el rostro en ese caso concreto, aunque introdujo cortes y movimiento adicional no deseados.
Esto muestra por qué R2V no debe tratarse como edición determinista: la fidelidad del movimiento, la fidelidad de identidad y la conservación de cámara pueden competir.
¿Cómo usar las referencias de audio en Seedance 2.5?
Las referencias de audio pueden orientar voz, diálogo, ritmo, música, ambiente e indicaciones sonoras, pero guiar el audio no equivale a fijar una pista sonora final.
Separa las funciones de voz, música y sonido
Si importa la coherencia vocal, dedica la referencia principalmente a la voz. Si la música controla el tiempo visual, asocia las acciones importantes a los compases. Evita pedir a una pista mezclada que controle identidad vocal, tiempos musicales y efectos sonoros a la vez cuando esas capas puedan separarse en un flujo de Seedance 2.5.
No consideres la referencia de audio una garantía de sincronización labial exacta
Un flujo en alemán revisado intentó conservar las palabras y la voz originales al generar imágenes correspondientes. A veces el resultado alteraba palabras, diálogo o características de voz. Entre las preguntas recurrentes también figuran cambios de voz y acentos no deseados.
Si un proyecto exige palabras exactas, audio grabado sin cambios y sincronización labial precisa a nivel de fonema, trátalos como requisitos de producción separados, sin asumir que una referencia de audio general los fijará automáticamente.
¿Cómo escribir un prompt de 30 segundos para Seedance 2.5?
La parte más difícil de una generación de 30 segundos con Seedance 2.5 es la continuidad de estados, no la duración.
Estructura cada fase en torno a acción, cámara y estado final
Divide la secuencia en unas pocas fases temporizadas. Cada una debe definir:
- acción principal
- sujeto relevante
- comportamiento de cámara
- estado final
El estado final importa porque la siguiente fase necesita un punto de partida lógico. Si un personaje termina una fase sosteniendo un producto junto a una puerta, la acción siguiente debe partir de esa configuración.
Trata las marcas de tiempo como controles de ritmo, no puntos de edición exactos al fotograma.
Usa edición por marcas de tiempo en lugar de regenerarlo todo
Seedance 2.5 también incorpora edición dirigida por marcas de tiempo, según el anuncio oficial de ByteDance.
Esto cambia el flujo de planos largos. Si una acción, un sonido o una sección falla, la edición dirigida puede ser más eficiente que rehacer toda la secuencia de 30 segundos. Para equipos de producción implica separar las decisiones de generación de las de corrección: establece primero el plano general y repara problemas locales cuando el flujo de edición lo permita.
Identifica cuándo 30 segundos resultan demasiado complejos
Una escena de siete actores con diálogo y múltiples interacciones produjo intentos fallidos costosos antes de dividirse en planos más sencillos.
En el extremo opuesto, un flujo de producto documentado creó un anuncio estilo vlog de 30 segundos con una imagen de producto y un prompt en una sola generación.
Por tanto, 30 segundos es una capacidad, no automáticamente la duración ideal de un plano. El número de personajes, el diálogo, la densidad de acciones y los cambios de cámara determinan el límite práctico de complejidad.
¿Cómo extender Seedance 2.5 para crear vídeos más largos?
Además de generar 30 segundos, Seedance 2.5 admite oficialmente la extensión en varias rondas. El reto de producción es decidir cuánto metraje anterior necesita realmente el siguiente segmento.
Usa solo el estado anterior necesario para la continuidad
Un flujo útil de continuación consiste en aportar aproximadamente los últimos 2–3 segundos del clip anterior, reutilizar referencias coherentes de personaje y entorno, e iniciar el siguiente prompt desde el estado final previo.
Volver a introducir metraje anterior innecesario puede hacer que el modelo repita acciones que ya ocurrieron.

El caso de 90 segundos muestra el coste real del vídeo largo con IA
El caso de producción larga más sólido de nuestra revisión buscaba un plano secuencia virtual de 90 segundos.
El flujo requirió:
- 32 generaciones
- 7 segmentos utilizables
- aproximadamente 3 días
- aproximadamente 150 USD de coste de generación
Según el informe, una configuración innecesaria de continuación desperdició unos 3 USD, mientras otra generación de unos 8,50 USD aportó solo alrededor de tres segundos utilizables.
La secuencia aún necesitó acabado en un editor no lineal, incluido flujo óptico y pequeños ajustes de encuadre.
Esto sugiere una métrica de producción más útil: coste por segundo utilizable, no coste por generación.

¿Qué revelan los casos de producción sobre los límites de Seedance 2.5?
Seedance 2.5 se vuelve menos predecible a medida que se acumulan sujetos, voces, interacciones, cambios de cámara y estados de escena.
La coherencia entre personajes mejora, pero la complejidad sigue importando
El caso de cinco personajes necesitó menos reintentos que su flujo 2.0, mientras que el de siete actores solo ganó fiabilidad al simplificar la escena.
ByteDance también afirma que Seedance 2.5 aún puede mejorar la plausibilidad física de movimientos complejos y la estabilidad de interacciones entre varios sujetos.
Esto coincide con la evidencia de producción: una gestión de referencias más capaz no elimina los límites de complejidad de escena.
Seedance 2.5 frente a Seedance 2.0: ¿cuál es mejor?
Seedance 2.5 es más fuerte en narración de 30 segundos, conjuntos mayores de referencias multimodales, referencias estructuradas y edición dirigida, pero 2.0 puede comportarse de forma distinta en tareas concretas.
Elige según los requisitos del plano, no el número de versión
En los flujos Seedance 2.5 revisados, 2.5 solía seguir las referencias más literalmente y reducir reintentos en secuencias complejas de personajes. Esa misma rigidez también revelaba incoherencias del guion gráfico.
Mientras tanto, algunos casos con 2.0 tendían más a completar movimientos no especificados, y un caso de sustitución de actor conservó mejor la identidad facial, aunque añadió movimiento no deseado.
La pregunta práctica es, por tanto: ¿qué versión produce la mayor tasa de resultados utilizables para este plano concreto?
Lista de diagnóstico de Seedance 2.5
Antes de reintentar, diagnostica qué control ha fallado.
Revisa primero el sistema de referencias
Pregúntate:
- ¿Cada referencia aporta información única?
- ¿Dos referencias compiten por el mismo atributo?
- ¿El guion gráfico es espacialmente coherente?
- ¿Cada fase de la línea de tiempo termina en un estado claro?
- ¿Se podría quitar una referencia sin perder control esencial?
Si el rostro cambia, revisa las referencias del personaje. Si falla el movimiento, simplifica su fuente. Si se intercambian voces, reduce las entradas de audio en competencia. Si la continuación repite metraje, acorta la referencia de vídeo anterior.
Depura el atributo que falló antes de ampliar el prompt. Este enfoque de diagnóstico también es central en un flujo estructurado de Seedance 2.5.
Preguntas frecuentes
¿Cuántas referencias debo usar en Seedance 2.5?
Seedance 2.5 admite hasta 30 referencias de imagen, 10 de vídeo y 10 de audio, pero la mayoría de los flujos deberían empezar con el conjunto más pequeño que describa claramente el plano. Añade otra referencia solo si aporta información que los recursos existentes no dan.
¿Puede Seedance 2.5 copiar exactamente el movimiento de una referencia de vídeo?
No con suficiente fiabilidad como para tratar R2V como captura de movimiento. Las referencias de vídeo son mejores para recorridos de cámara, posiciones en escena, tiempos e intención de movimiento. Para mayor control, usa metraje de movimiento simplificado o previsualización, manteniendo identidad y diseño visual final en referencias de imagen separadas.
¿Puede Seedance 2.5 conservar mi audio original y sincronizar los labios exactamente?
No asumas que una referencia de audio impone un bloqueo estricto. Los flujos revisados incluyen cambios de palabras, características vocales y acentos. Si es obligatorio conservar el diálogo grabado exacto, trata la conservación de audio y la sincronización labial precisa como requisitos separados.
¿Por qué Seedance 2.5 empeora cuando añado más referencias?
Más referencias crean más conflictos de control posibles. Cuando varios recursos describen de forma distinta identidad, estilo, movimiento, entorno o voz, la atribución se vuelve menos predecible. Reduce referencias redundantes, asigna una función principal a cada recurso y depura el atributo concreto que falló antes de añadir material.
Conclusión
Seedance 2.5 resulta más útil al tratarlo como un sistema de referencias multimodales, no un generador de vídeo basado solo en prompts. Sus 30 segundos de generación, gran capacidad de referencias de imagen/vídeo/audio, extensión y edición dirigida abren más posibilidades profesionales, pero los casos documentados muestran que el éxito sigue dependiendo del diseño de referencias de Seedance 2.5: un anuncio sencillo puede funcionar en una generación, mientras una secuencia continua de 90 segundos puede requerir 32 intentos y mucha posproducción. Por tanto, el mejor flujo no consiste en usar más entradas, sino en asignar a cada referencia una responsabilidad clara, diseñar la continuidad antes de generar y optimizar los resultados utilizables, no los límites teóricos del modelo. Para equipos que pasan de experimentar a producir, un flujo estructurado de Seedance 2.5 ofrece el siguiente paso más claro.
Más del blog de Virse
Flujo de trabajo

GPT Image 2.5 Noise and Oversharpening: Why Some Images Still Look AI-Generated
9 de octubre de 2026 by Yifan Zhao
Flujo de trabajo

GPT Image 2.5 Keeps Changing My Image: How to Use a "Keep List" for Reliable Edits
9 de octubre de 2026 by Yifan Zhao
Flujo de trabajo

GPT Image 2.5 Editing Drift: Why Images Get Blurry, Cropped or Worse After Multiple Edits
9 de octubre de 2026 by Yifan Zhao