Guía de referencias de MiniMax H3: imágenes, vídeo y audio explicados
Yifan Zhao12 min de lectura ·

Las referencias de MiniMax H3 permiten controlar el aspecto, el movimiento y el sonido de un vídeo con distintos recursos de origen. Las imágenes son ideales para identidad, vestuario, productos y entornos; los vídeos, para movimiento, interpretación, cámara y tiempos; y el audio, para timbre vocal, música, ritmo y características sonoras. Estos controles son especialmente importantes en la transferencia de movimiento de MiniMax H3, donde distintas referencias pueden encargarse por separado de identidad, movimiento, cámara y sonido.
El reto es evitar que las referencias compitan. Un vídeo de movimiento puede filtrar apariencia, varias imágenes pueden disputarse la identidad y Ref2VA puede sacrificar nitidez por mayor flexibilidad de referencias. En la práctica, los mejores resultados llegan al definir qué debe conservar, transferir e ignorar cada referencia antes de generar. Un prompt estructurado de MiniMax H3 y un flujo repetible de MiniMax H3 facilitan controlar esas responsabilidades.
Para los equipos que amplían estos flujos, Virse reúne referencias, recursos y múltiples agentes de IA en un lienzo infinito con contexto creativo compartido y memoria visual a largo plazo. Virse ofrece más de 50 modelos en un solo lienzo, incluidos Nano Banana 2, GPT Image 2 y Seedance 2.0, para convertir la generación guiada por referencias en un flujo de diseño con IA más amplio. Los nuevos usuarios pueden empezar con créditos gratuitos, mientras los planes de pago desbloquean modelos prémium y uso ilimitado de determinados modelos rápidos para producciones mayores.

¿Qué son las referencias de MiniMax H3 y cómo funcionan?
Una referencia de MiniMax H3 es una imagen, un vídeo o un audio que aporta atributos concretos a una nueva generación. La forma más fiable de usar H3 es pensar en la responsabilidad de la referencia, no en el tipo de archivo.
Referencia | Ideal para | Función habitual |
|---|---|---|
Imagen | Aspecto estable | Identidad, vestuario, producto, entorno |
Imagen de anclaje | Estado visual concreto | Composición, encuadre, estado inicial o final |
Vídeo | Comportamiento temporal | Movimiento, interpretación, cámara, ritmo |
Audio | Características sonoras | Voz, música, ritmo, textura |
Un reparto sencillo puede asignar la imagen 1 a la identidad, la imagen 2 al vestuario, el vídeo 1 a la coreografía, el vídeo 2 al movimiento de cámara y el audio 1 al timbre vocal. El enfoque de «una referencia, una tarea principal» no es una limitación técnica, sino una forma práctica de reducir la ambigüedad.
Límites de referencias de MiniMax H3
Las especificaciones oficiales de H3 también importan al planificar un flujo.
Entrada o salida | Límite |
|---|---|
Imágenes de referencia | Hasta 9 |
Vídeos de referencia | Hasta 3, de 2–15 segundos cada uno, 15 segundos en total |
Audio de referencia | Hasta 3, de 2–15 segundos cada uno, 15 segundos en total |
Archivos de referencia combinados | Hasta 12 |
Entrada Ref2VA solo de audio | No admitido |
Duración de salida | 4–15 segundos |
Frecuencia de fotogramas de salida | 24 FPS |
Audio nativo | Estéreo de 32 kHz |
La implicación práctica es sencilla: hay más referencias disponibles de las que la mayoría de los proyectos deberían usar realmente. Empieza con el conjunto más pequeño que defina claramente el plano.

¿Cómo controlan la identidad y el aspecto las referencias de imagen de MiniMax H3?
Una imagen de referencia de MiniMax H3 es ideal para atributos que deben seguir siendo reconocibles entre fotogramas, como rostro, peinado, vestuario, geometría del producto, materiales, entorno y estilo visual.
Referencias de sujeto e imágenes de anclaje en MiniMax H3
Una referencia de sujeto representa una persona u objeto reutilizable. Una imagen de anclaje se acerca más a una composición o estado visual concretos.
Usa una referencia centrada en el sujeto cuando el requisito sea «conserva este personaje o producto». Usa un flujo centrado en el fotograma cuando el requisito sea «empieza o termina en esta imagen concreta».
Coherencia de personajes y productos
Para personajes, una referencia de identidad limpia suele ser más útil que varios retratos inconsistentes. Las diferencias contradictorias de pelo, edad, ropa o proporciones pueden debilitar la conservación de la identidad.
Los productos exigen restricciones aún más estrictas. Un plano cinematográfico sigue siendo inutilizable si el logotipo se desplaza o cambia la silueta. En trabajos de marca, conserva explícitamente proporciones, posición del logotipo, materiales, colores y detalles estructurales distintivos.
¿Cómo controlan el movimiento y la cámara las referencias de vídeo de MiniMax H3?
Las referencias de vídeo son más útiles para información que se desarrolla en el tiempo: movimiento corporal, coreografía, interpretación, tiempos de los gestos, trayectorias de cámara, ritmo, cortes y ritmo de edición.
Transferencia de identidad e interpretación en MiniMax H3
Uno de los patrones más eficaces de Ref2VA es:
La imagen A define quién es el personaje. El vídeo B define qué hace.
Por ejemplo, un flujo de moda puede usar una imagen para la identidad, otra para la ropa, un vídeo para la forma de caminar y otro para la cámara. Así separa identidad visual y movimiento, en lugar de pedir a un solo prompt que invente ambos.
Flujos de referencias de cámara en MiniMax H3
El vídeo también puede definir la cámara en lugar del actor. Una imagen de producto puede conservar la geometría mientras un vídeo sin relación aporta una órbita lenta, un acercamiento, un seguimiento cámara en mano o un movimiento similar al de una grúa.
Desde el diseño, esto importa porque el lenguaje de cámara forma parte de la dirección creativa. Un mismo producto puede parecer prémium, enérgico o documental según cómo se mueva el plano.
Por qué «solo movimiento» aún puede filtrar apariencia
«Usa este vídeo solo para el movimiento» es una instrucción, no una frontera de extracción perfecta. La ropa, la forma corporal, la iluminación u otros rasgos visuales todavía pueden filtrarse desde el origen.
Cuando ocurre, la mejor primera solución suele ser simplificar las referencias, reforzar la fuente de identidad deseada y limitar la función del vídeo.
¿Cómo funcionan las referencias de audio de MiniMax H3?
H3 puede generar audio y vídeo conjuntamente, de modo que el sonido forme parte del sistema creativo y no solo de una capa de posproducción.
Las referencias de audio pueden influir en el timbre vocal, la forma de hablar, la música, el ritmo, la estructura de la banda sonora, los efectos y la textura sonora.
Reutilización y referencia de audio en MiniMax H3
Reutilizar audio significa conservar toda o parte de una señal existente. Usarlo como referencia significa tomar características permitiendo que cambie el contenido generado.
Esta distinción importa para diálogos nuevos. Si el origen debe definir al hablante y no las palabras, la dirección creativa debe enfatizar el timbre vocal y la forma de hablar, no limitarse a reutilizar el audio original.
Fallos de audio de MiniMax H3
Nuestra revisión de flujos documentados de H3 encontró problemas recurrentes, entre ellos:
- sílabas repetidas
- habla distorsionada
- diálogo parecido a un galimatías
- cruce de voces entre personajes
- sincronización labial deficiente
- audio que termina antes que la secuencia visual
Un flujo documentado de Spectrum de 20 pasos utilizó 11 evaluaciones reales del transformer y predijo nueve pasos intermedios, reduciendo el trabajo del muestreador alrededor de un 45 %. Ese mismo flujo también produjo audio más áspero y sílabas repetidas.
La lección para producción es importante: una optimización que conserve fotogramas aceptables puede seguir perjudicando el diálogo.
FL2VA o Ref2VA en MiniMax H3: ¿cuál usar?
FL2VA y Ref2VA resuelven problemas de control distintos.
Requisito | Mejor opción |
|---|---|
Control exacto del primer fotograma | FL2VA |
Control exacto del último fotograma | FL2VA |
Personaje y movimiento | Ref2VA |
Personaje y cámara | Ref2VA |
Varias imágenes de referencia | Ref2VA |
Referencia de audio | Ref2VA |
Composición multimodal compleja | Ref2VA |
Usa FL2VA cuando el propio fotograma sea la restricción principal. Usa Ref2VA cuando los distintos atributos deban proceder de referencias diferentes.
Cuándo conviene más FL2VA
FL2VA suele ser la opción más sencilla si ya tienes una imagen clave diseñada, un fotograma de storyboard o un estado final obligatorio. Si el control con varias referencias no aporta valor creativo real, Ref2VA puede introducir complejidad innecesaria.
Cuándo conviene más Ref2VA
Ref2VA es más potente cuando el plano combina identidad, vestuario, movimiento, cámara y sonido de fuentes diferentes.
En los flujos de nuestra investigación, menor nitidez, más grano y menos detalle percibido fueron preocupaciones recurrentes con Ref2VA. Estas observaciones no son un benchmark controlado con la misma semilla, pero revelan un compromiso útil: un control más profundo de referencias puede reducir la fidelidad visual percibida.
¿Cómo combinar varias referencias de MiniMax H3 sin conflictos?
Un flujo fiable con varias referencias empieza por tres preguntas:
¿Qué debe mantenerse igual? ¿Qué debe transferirse? ¿Qué debe ignorarse?
Para un vídeo de personaje:
- Conservar: rostro, peinado, vestuario
- Transferir: coreografía, trayectoria de cámara, características de voz
- Ignorar: identidad del intérprete original, ropa no deseada, detalles irrelevantes del fondo
Para un anuncio de producto:
Variable creativa | Fuente |
|---|---|
Geometría del producto | Imagen del producto |
Actor | Imagen del personaje |
Entorno | Imagen del lugar |
Cámara | Referencia de vídeo |
Voz o campanilla | Referencia de audio |
Tiempos | Prompt |
Antes de renderizar, comprueba si dos referencias definen de manera distinta el mismo atributo. Eliminar una referencia conflictiva suele mejorar el control más que añadir texto al prompt.
¿Cómo escribir un mejor prompt de referencias para MiniMax H3?
Un buen prompt de H3 se lee como un briefing de producción compacto.
Define funciones y conservación de referencias
Empieza indicando qué controla cada fuente y fija después los detalles que no pueden cambiar: rostro, peinado, vestuario, forma del producto, logotipo, color o material.
Escribe la escena como una línea temporal
Los prompts de vídeo deben describir cuándo ocurren las acciones. Un plano de 15 segundos puede presentar primero la escena, introducir después la interpretación, añadir más tarde una órbita de cámara y terminar con diálogo.
Así das a H3 una estructura temporal y al equipo creativo puntos claros de revisión.
Separa cámara, sonido y restricciones negativas
Las instrucciones de cámara deben describir cómo se captura la escena: órbita, acercamiento, movimiento cámara en mano, cambio de foco o poca profundidad de campo.
Las instrucciones de sonido deben definir por separado hablante, referencia vocal, ambiente, música y tiempos. Las restricciones negativas deben centrarse en fallos críticos de producción, como cambiar un logotipo, heredar al actor incorrecto o introducir una segunda voz.
El objetivo no es un prompt más largo, sino menos decisiones ambiguas.
¿Qué datos de rendimiento de MiniMax H3 importan en la práctica?
Nuestra revisión incluye varios flujos locales. No son benchmarks estandarizados, pero muestran lo rápido que puede aumentar el coste de iteración.
Hardware / flujo | Resultado reportado |
|---|---|
RTX 4070 Ti SUPER 16 GB | 640×832: 1,63 s en 2 min 09 s; 736×960: 6,58 s en 6 min 55 s |
RTX 6000 PRO 96 GB | 1K: base de 14 s, EasyCache de 8 s; 2K: base de 37 s, EasyCache de 22 s |
Producción larga con RTX 5090 | Unos 10 min para un clip de 15 s a unos 1,5 MP |
768×1280, 20 pasos | 5 s: 2 min; 10 s: 6 min; 20 s: 20 min; 30 s: 43 min |
La principal lección práctica es que las generaciones más largas pueden volverse desproporcionadamente costosas. Haz borradores baratos para validar referencias, movimiento, encuadre y semilla antes de invertir en la calidad final.

¿Puede MiniMax H3 generar imágenes fijas?
H3 también se ha usado en flujos experimentales de imágenes fijas para carteles, hojas de personaje, cambios de vestuario, ubicación y ángulo de cámara. Un flujo documentado con RTX 5090 en RunPod reportó aproximadamente ocho segundos para editar una imagen de 1920×1088.
Es más adecuado entenderlo como una solución alternativa de flujo, no como un modo nativo oficial de imagen.
¿Cómo mantener coherentes los vídeos largos de MiniMax H3?
Como la salida nativa dura entre 4 y 15 segundos, las producciones más largas suelen requerir continuación por segmentos.
Un flujo documentado pasaba unos 22 fotogramas anteriores a la siguiente generación. Otro reutilizaba los últimos dos o tres segundos de cada sección al montar un proyecto de unos dos minutos.
Un flujo práctico de producción larga es:
- Genera un clip corto.
- Selecciona la toma lograda.
- Conserva el estado visual final.
- Reutiliza las referencias de identidad y vestuario.
- Genera el siguiente segmento.
- Une los clips logrados.
- Revisa por separado la continuidad de voz, ambiente y música.
Las hojas de personaje también ayudan al definir frente, perfil, cuerpo, peinado, ropa y accesorios desde varias vistas.
Buenas prácticas de referencias de MiniMax H3
Para una producción fiable, reúne estos principios en una lista de comprobación:
- Asigna una tarea principal a cada referencia.
- Separa identidad e interpretación.
- Elimina referencias en conflicto antes de complicar el prompt.
- Escribe explícitamente los tiempos y los momentos de la escena.
- Fija los atributos críticos de marca, producto e identidad.
- Evalúa el audio por separado de la calidad visual.
- Haz borradores baratos y después dedica cómputo a la versión que merezca terminarse.
Es más fácil repetir estos principios cuando forman parte de un flujo documentado de MiniMax H3, en lugar de reinventarlos en cada generación.
Preguntas frecuentes
¿Por qué Ref2VA se ve más borroso que FL2VA?
Nuestra revisión encontró informes recurrentes de detalle más suave, más grano y menor nitidez percibida en algunos flujos Ref2VA. No es un benchmark controlado universal. Si solo necesitas controlar bien el primer o último fotograma, FL2VA puede ser más sencillo; usa Ref2VA cuando necesites flexibilidad multirreferencia.
¿Debo usar FL2VA o Ref2VA?
Usa FL2VA cuando el fotograma inicial o final sea la restricción dominante. Usa Ref2VA cuando necesites combinar identidad, ropa, movimiento, cámara o audio de distintas fuentes. El mejor modo es el que introduce menos complejidad de control innecesaria.
¿Puede H3 crear vídeos de más de 15 segundos?
Sí, pero los proyectos largos suelen montarse con varias generaciones cortas. Los flujos prácticos reutilizan fotogramas finales, segundos de metraje previo, referencias de personaje y una dirección sonora coherente para reducir las discontinuidades entre segmentos.
¿Puede H3 generar imágenes fijas?
H3 puede usarse para generar y editar imágenes fijas mediante flujos experimentales, aunque no equivale a un modo nativo oficial de imagen. Los usos documentados incluyen carteles, hojas de personaje, cambios de vestuario y de ángulo de cámara.
Conclusión
MiniMax H3 alcanza su mayor potencial cuando las referencias de imagen, vídeo y audio se tratan como fuentes separadas de responsabilidad creativa y no como un montón de contexto. Las imágenes suelen definir la identidad visual estable; los vídeos, el comportamiento temporal; el audio, las características sonoras; y el prompt, cómo interactúan esas fuentes. Ref2VA ofrece un control multimodal más profundo, pero esa flexibilidad puede implicar compromisos en nitidez, fiabilidad del audio, coherencia y coste computacional. La estrategia más sólida consiste en asignar funciones claras, separar identidad e interpretación, fijar atributos críticos, estructurar escenas en el tiempo, validar el audio por separado e iterar con bajo coste antes del render final. Para equipos que deciden dónde conviene este enfoque intensivo en referencias, dónde usar MiniMax H3 ofrece un siguiente paso práctico.
Más del blog de Virse
Flujo de trabajo

GPT Image 2.5 Noise and Oversharpening: Why Some Images Still Look AI-Generated
9 de octubre de 2026 by Yifan Zhao
Flujo de trabajo

GPT Image 2.5 Keeps Changing My Image: How to Use a "Keep List" for Reliable Edits
9 de octubre de 2026 by Yifan Zhao
Flujo de trabajo

GPT Image 2.5 Editing Drift: Why Images Get Blurry, Cropped or Worse After Multiple Edits
9 de octubre de 2026 by Yifan Zhao