Cómo usar MiniMax H3: guía completa de ComfyUI, prompts, referencias, audio y rendimiento

Yifan ZhaoYifan Zhao11 min de lectura ·

Cómo usar MiniMax H3: guía completa de ComfyUI, prompts, referencias, audio y rendimiento

Para usar MiniMax H3 eficazmente, elige T2V para generar desde texto, I2V cuando una imagen existente deba fijar la escena y R2V si necesitas controlar mejor la identidad, el movimiento, la cámara, el estilo o la voz. En ComfyUI, empieza con una prueba breve a baja resolución, ajusta el prompt y las referencias, y aumenta la calidad cuando el plano funcione. Así también resulta más fácil gestionar un flujo de trabajo estructurado de MiniMax H3. Para conocer mejor sus ventajas y limitaciones prácticas, consulta la reseña de MiniMax H3.

La dificultad no es conseguir que H3 genere, sino obtener resultados repetibles y utilizables en producción. Un checkpoint incorrecto puede debilitar las referencias, los prompts ambiguos pueden asignar el diálogo al personaje equivocado y las pruebas a alta resolución encarecen cada idea fallida. Un buen prompt de MiniMax H3 reduce la ambigüedad, mientras que un flujo de producción de H3 disciplinado separa concepto, identidad, acción, cámara, audio y calidad final en decisiones que puedes probar por separado.

Virse facilita la gestión de ese proceso creativo más amplio. En lugar de limitar el trabajo con IA a chats aislados, permite organizar referencias, recursos y decisiones en un lienzo infinito mientras varios agentes comparten el contexto del proyecto. Su diseño también se centra en aprender las preferencias del equipo, las normas de marca y el contexto creativo previo, para integrar la generación en un flujo de diseño con IA coherente en vez de añadir otra herramienta desconectada. Los agentes de diseño con IA también pueden apoyar procesos creativos más coordinados.

Captura de la interfaz de exploración de recursos creativos de Virse

Cómo usar MiniMax H3 en ComfyUI

MiniMax H3 es un sistema de generación de vídeo omnimodal que entiende texto, imágenes, vídeo y audio y genera conjuntamente vídeo y audio estéreo. ComfyUI ofrece flujos nativos T2V, I2V y R2V con pesos abiertos; su documentación actual exige ComfyUI 0.30.0 o posterior, por lo que la biblioteca oficial de plantillas es el punto de partida más sencillo. Si lo configuras por primera vez, esta guía de uso de MiniMax H3 explica el proceso general.

Un flujo práctico para la primera generación es:

  1. Actualiza ComfyUI.
  2. Abre Template Library (biblioteca de plantillas) → Video → MiniMax H3.
  3. Elige T2V, I2V o R2V.
  4. Carga el modelo de difusión correcto y los codificadores y VAE necesarios.
  5. Genera una vista previa breve.
  6. Comprueba identidad, movimiento, dirección de cámara, diálogo y audio.
  7. Cambia una sola variable importante cada vez.
  8. Aumenta la resolución solo cuando el plano sea fiable.

¿Qué modelos de MiniMax H3 necesitas?

T2V, I2V y la generación con fotogramas inicial y final utilizan FL2VA, mientras que R2V basado en referencias utiliza Ref2VA. Ambos flujos también requieren el codificador de texto Qwen3-VL y los VAE de vídeo y audio de H3. ComfyUI documenta expresamente esta separación de checkpoints, así que comprobar el modelo de difusión debe ser el primer paso si parece que se ignoran las referencias.

MiniMax H3: T2V frente a I2V y R2V

Flujo

Uso más adecuado

Control principal

T2V

Explorar conceptos y escenas nuevas

Texto

I2V

Animar una composición existente

Imagen inicial

Fotogramas inicial y final

Transiciones planificadas

Fotogramas de apertura y cierre

R2V

Coherencia de identidad, movimiento, cámara, estilo o voz

Referencias multimodales

Usa T2V si prima la exploración, I2V si importa la composición y R2V si necesitas coherencia. Tratar R2V como un I2V más potente es un error habitual: emplea pesos distintos y una estrategia de referencias más explícita.

Cómo escribir mejores prompts para MiniMax H3

Un buen prompt de MiniMax H3 se parece más a un brief de producción audiovisual que a un prompt de imagen. La guía oficial de MiniMax organiza la generación en torno a la descripción multimodal del plano, el paisaje sonoro general y la música extradiegética; por eso conviene planificar juntos la dirección visual y el audio. La guía de prompts de MiniMax H3 ayuda a estructurar esas instrucciones de forma más sistemática.

Escribe los prompts de MiniMax H3 por planos

Define primero la escena y la composición inicial; después describe acciones observables y movimientos de cámara a lo largo del tiempo. En vídeos de varios planos, la guía usa Shot 1 sin marca temporal e introduce los siguientes con tiempos de corte explícitos. Los intervalos temporales sirven para planificar el storyboard, pero no son el formato final documentado.

Una secuencia útil para planificar es:

Función de referencia → Plano → Sujeto → Acción → Cámara → Diálogo → Efectos sonoros → Paisaje sonoro → Música

En vez de pedir una «presentación cinematográfica del producto», especifica qué cambia: la cámara se acerca lentamente al producto, el sujeto lo gira hacia la luz, se oye un clic mecánico y el siguiente plano corta a un detalle cercano.

Controla el diálogo y el audio de MiniMax H3

H3 genera diálogo, ambiente, efectos sonoros y música junto al vídeo. MiniMax recomienda mantener estables las identidades de los hablantes entre planos, especialmente cuando aparecen dos o más personajes.

Nuestra revisión de preguntas reales detectó diálogos atribuidos al personaje equivocado y movimientos de labios involuntarios como problemas recurrentes. Mantén estrechamente vinculados la identidad, la acción y el diálogo de cada hablante. Para narración, indica expresamente que es una voz en off y que el personaje visible no debe hablar.

Cómo usar las referencias R2V de MiniMax H3 para mejorar la coherencia

MiniMax H3 R2V admite hasta 9 imágenes, 3 vídeos y 3 clips de audio de referencia, con un máximo conjunto de 12 archivos. La documentación del modelo confirma estos límites, pero rara vez conviene llenar todos los cupos.

Límites de referencias R2V de MiniMax H3


La regla más útil es: asigna a cada referencia una responsabilidad principal.

Por ejemplo:

  • La imagen 1 controla la identidad del personaje.
  • La imagen 2 controla el entorno o el estilo visual.
  • El vídeo 1 controla el movimiento y la cámara.
  • El audio 1 controla la voz.

La guía completa de referencias de MiniMax distingue sujetos, anclajes de imagen, estructura de vídeo y señales de audio, reforzando que las relaciones entre referencias deben ser explícitas, no implícitas.

Capacidad de referencias R2V de MiniMax H3


ref_image_size de MiniMax H3: match frente a max

ComfyUI ofrece dos estrategias prácticas para imágenes de referencia. match prioriza la velocidad ajustando la referencia hacia la resolución de generación, mientras que max conserva hasta 2048 píxeles en el lado corto para mejorar la fidelidad de identidad, con mayor coste de procesamiento.

Para rostros, productos o personajes detallados, max puede compensar una iteración más lenta. Para entornos o estilos generales, match suele ser un punto de partida más eficiente.

Resolución de MiniMax H3: 768p local frente a salida 2K

La frase «MiniMax H3 admite 2K» necesita contexto.

¿A qué resolución genera MiniMax H3 local?

El flujo abierto de H3-Base produce salida de categoría 768p. ComfyUI recomienda un lado corto de 768 píxeles y aproximadamente 1344×768 en 16:9 para un lienzo local de calidad completa; ajustes de menos megapíxeles son mejores para iterar con vistas previas.

¿Cómo genera MiniMax H3 en 2K?

La ficha oficial del modelo explica que el sistema H3 completo incluye H3-Context-IR, H3-Base y H3-Regenerate-2K. H3-Base genera primero un resultado 768p; H3-Regenerate-2K utiliza ese resultado junto al contexto multimodal original para regenerar detalles a mayor resolución, en lugar de aplicar superresolución convencional.

MiniMax H3: salida local y alojada


Context-IR y Regenerate-2K son actualmente componentes alojados, no parte de la publicación de pesos abiertos. El flujo API de MiniMax ofrece hasta 2K y entre 5 y 15 segundos por clip, por lo que la generación local 768p y la salida 2K alojada no deben considerarse flujos idénticos.

Duración de clips alojados de MiniMax H3

¿Cuánta VRAM necesita MiniMax H3?

No hay un único mínimo de VRAM útil, porque el rendimiento depende de VRAM, RAM del sistema, resolución, duración, pasos, cuantización, descarga a otra memoria e implementación de atención.

En nuestra revisión de flujos locales documentados, una configuración RTX 4090 Laptop con 16 GB de VRAM y 32 GB de RAM generó un vídeo de cinco segundos a 960×540 con audio en 182 segundos, usando 20 pasos y Sage Attention. Es un caso real útil, pero no una prueba comparativa controlada.

La investigación también recoge equipos con menos VRAM donde una descarga intensiva permitió ejecutar H3. La distinción práctica importa: una GPU puede completar una generación sin ser suficientemente rápida para una iteración creativa cómoda.

Caso documentado de generación local H3


Cómo acelerar MiniMax H3 con Sage Attention

Para acelerar H3, reduce primero la duración y la resolución. Ambas disminuyen directamente la cantidad de vídeo que debe generar el modelo y abaratan mucho las pruebas de prompts.

Después, Sage Attention es la optimización más claramente documentada. ComfyUI afirma que puede aproximadamente duplicar la velocidad de generación de H3 con una pérdida mínima de calidad, aunque la mejora exacta depende de la configuración.

En flujos profesionales, conviene probar los ajustes de velocidad mediante A/B. Compara el mismo prompt y semilla y revisa rostros, sujetos lejanos, detalles finos del producto, continuidad del movimiento y sincronización de audio antes de adoptar una aceleración agresiva.

Problemas frecuentes de MiniMax H3 y sus soluciones

Problema

Solución más probable

R2V ignora las referencias

Confirma que esté cargado Ref2VA y asigna una función clara a cada referencia

Habla el personaje equivocado

Estabiliza la identidad del hablante y vincula su diálogo a su acción

Los labios se mueven durante la voz en off

Define expresamente una narración fuera de campo y un sujeto visible que no habla

La identidad cambia

Reduce referencias en conflicto o aumenta el detalle de la imagen de referencia

La generación es demasiado lenta

Acorta la duración, baja la resolución de vista previa y activa Sage Attention

Faltan nodos de H3

Actualiza ComfyUI y vuelve a cargar la plantilla oficial de H3

Esta estructura de diagnóstico refleja los problemas más frecuentes de nuestra revisión de preguntas sobre H3. En la práctica, simplificar el flujo suele funcionar mejor que añadir instrucciones al prompt.

¿Cuál es el mejor flujo de MiniMax H3 para producción?

Para trabajo profesional de vídeo y diseño recomiendo un proceso de iteración por planos:

Vista previa → A/B de prompts → A/B de referencias → Versión elegida → Render a calidad nativa → 2K o acabado si hace falta → Edición

Este enfoque convierte H3 en un sistema creativo controlado. T2V explora ideas, I2V fija composiciones diseñadas, R2V conserva referencias visuales o sonoras importantes y las vistas previas breves revelan problemas antes de una generación final costosa. Un flujo de producción específico de MiniMax H3 puede formalizar esa secuencia.

Desde el diseño de producto, esto también escala mejor que pedir a un único prompt que resuelva simultáneamente concepto, identidad, cámara, movimiento, diálogo y acabado. El objetivo no es tomar menos decisiones, sino abaratar y facilitar la evaluación de cada una. También importa saber dónde usar MiniMax H3, porque no todas las tareas creativas necesitan el mismo grado de control multimodal.

Preguntas frecuentes

¿Puede H3 funcionar con 12 GB de VRAM?

H3 puede ejecutarse en hardware de consumo limitado mediante modelos cuantizados y descarga de memoria, pero la VRAM por sí sola no permite predecir la velocidad. También influyen resolución, duración, RAM, variante del modelo, pasos y optimización de atención. Una prueba más útil es medir cuánto tarda la vista previa de cinco segundos que necesitas con los ajustes que realmente usarás.

¿Por qué no funciona mi referencia R2V de H3?

Primero confirma que utilizas Ref2VA en lugar de FL2VA. Después asigna a cada imagen, vídeo o audio una responsabilidad concreta: identidad, entorno, movimiento, cámara o voz. Si varias referencias compiten por definir la misma propiedad, redúcelas antes de complicar el prompt.

¿Los prompts de H3 deben usar Shot 1 o intervalos temporales?

Puedes usar intervalos temporales para planificar el storyboard, pero la guía oficial de prompts base de MiniMax organiza el prompt final en planos secuenciales, introduciendo los posteriores con tiempos de corte explícitos. La diferencia importa porque una técnica útil de planificación creativa no equivale necesariamente a la estructura de prompt documentada del modelo.

¿H3 local genera 2K nativo?

No con H3-Base por sí solo. El flujo abierto de H3-Base genera salida de categoría 768p. El sistema completo de MiniMax usa H3-Regenerate-2K para regenerar el resultado base con el contexto original, mientras que la API oficial puede entregar hasta 2K.

Conclusión

MiniMax H3 funciona mejor como un flujo estructurado de producción audiovisual que como un atajo de vídeo con un solo prompt. Elige T2V, I2V o R2V según la restricción creativa, usa correctamente FL2VA o Ref2VA, asigna funciones claras a las referencias, describe planos y acciones de cámara observables, dirige el audio junto a la imagen y valida ideas con vistas previas económicas antes de subir la resolución. La cuestión práctica no es solo si H3 funciona en tu hardware, sino si permite iterar con rapidez suficiente para tomar buenas decisiones. Una vez estable el flujo de MiniMax H3, la generación local 768p, el acabado 2K alojado y Virse pueden integrarse en un proceso profesional de diseño con IA mucho más escalable.

Más del blog de Virse