Cómo usar la transferencia de movimiento de MiniMax H3: guía de vídeo a vídeo
Yifan Zhao13 min de lectura ·

La transferencia de movimiento de MiniMax H3 permite que un vídeo de referencia controle el movimiento, los tiempos, la cámara o la interpretación, mientras que imágenes y audios separados definen la identidad, el aspecto y la voz del personaje. Si estás aprendiendo a usar MiniMax H3, el principal reto no es lograr que H3 reconozca el movimiento, sino asegurarte de que cada referencia controle el atributo correcto.
Una referencia de vídeo también contiene un actor, fondo, encuadre, expresiones, comportamiento de cámara y, a menudo, audio. Cuando estas señales compiten, pueden filtrarse rasgos de identidad, desviarse el movimiento, cambiar el fondo o aparecer rostros inconsistentes. Los flujos de MiniMax H3 más fiables reducen este conflicto definiendo con claridad qué debe conservarse, qué debe cambiar y qué referencia decide cada aspecto. Un prompt estructurado de MiniMax H3 facilita mucho comunicar esa responsabilidad.
Para los equipos que quieren convertir estos flujos en una producción repetible, Virse combina la generación con IA con un espacio de lienzo infinito diseñado para la colaboración creativa profesional. Su enfoque de flujo creativo multiagente mantiene conectados referencias, resultados y contexto del proyecto, mientras que un flujo de diseño con IA desde el briefing hasta la entrega más amplio ayuda a repartir el trabajo entre varios modelos. Los planes de pago incluyen uso ilimitado de más de 40 modelos, como Nano Banana 2 y GPT Image 2, y puestos ilimitados. Los nuevos usuarios también reciben créditos gratuitos, suficientes para unas 10 imágenes de Nano Banana 2 o un vídeo de Seedance 2.0.

¿Qué son la transferencia de movimiento y la generación por referencias de MiniMax H3?
La transferencia de movimiento de MiniMax H3 se entiende mejor como una aplicación del sistema más amplio de generación por referencias de H3. En lugar de tratar el vídeo de origen como una plantilla completa, H3 puede combinar imágenes, vídeos, audio y texto para que distintas entradas influyan en diferentes partes del resultado.
Transferencia de movimiento de MiniMax H3 frente a V2V tradicional
Los flujos V2V tradicionales suelen conservar gran parte de la estructura del vídeo original mientras transforman su aspecto. H3 puede ser más selectivo.
Referencia | Mejor función | Riesgo principal |
|---|---|---|
Imagen | Identidad, rostro, ropa | Filtración de la pose o el fondo |
Vídeo | Movimiento, tiempos, cámara, interpretación | Filtración del actor o la escena originales |
Audio | Características de la voz | Voz no coincidente |
Prompt | Define las relaciones | Instrucciones contradictorias |
El cambio útil consiste en pasar de «transforma este vídeo» a «decide qué debe aportar este vídeo».
Las especificaciones actuales de generación por referencias de H3 revisadas para este artículo admiten hasta 9 imágenes, 3 vídeos, 3 clips de audio y 12 archivos de referencia combinados. Los vídeos de referencia pueden sumar hasta 15 segundos, el audio hasta 15 segundos y los resultados durar entre 4 y 15 segundos.

Transferencia de movimiento, edición de vídeo e I2V en MiniMax H3
Estos flujos resuelven problemas diferentes. La transferencia de movimiento utiliza un vídeo para guiar el movimiento, los tiempos, la cámara o la interpretación. La edición de vídeo parte de un vídeo existente y modifica contenidos seleccionados intentando conservar el resto. I2V parte de una imagen fija y genera movimiento nuevo en lugar de reproducir el de un vídeo de origen.
Para los diseñadores, esta distinción importa porque la transferencia de movimiento trata fundamentalmente de relaciones entre referencias, no solo de animación. Entender dónde usar MiniMax H3 ayuda a determinar si conviene más Ref2V, la edición u otro método de generación.
Cómo mejora la transferencia de movimiento la asignación de atributos a referencias en MiniMax H3
El marco más útil para analizar H3 es la asignación de atributos a referencias: cada entrada debe tener una responsabilidad clara.
Asigna por separado movimiento, identidad, cámara y audio
Para un reemplazo típico de personaje:
El vídeo 1 aporta el movimiento y los tiempos. La imagen 1 aporta la identidad y el aspecto. El prompt define qué debe conservarse y qué debe cambiar.
En otro plano, el vídeo 1 podría aportar la trayectoria de la cámara. Un vídeo en primer plano puede aportar la interpretación facial. El audio puede aportar las características de la voz.
Los problemas empiezan cuando varias fuentes compiten por el mismo atributo. Una imagen de personaje puede definir un rostro nuevo mientras el vídeo refuerza intensamente al actor original.
Reduce la filtración de referencias antes de añadir detalles al prompt
Nuestra revisión de flujos documentados y preguntas recurrentes de usuarios muestra que muchos fallos aparentes del prompt son en realidad problemas de filtración de referencias.
Una secuencia práctica es:
- Define cada fuente.
- Asigna una función principal.
- Indica qué atributos deben conservarse.
- Indica qué atributos deben cambiar.
- Describe solo el nuevo contenido deseado.
Una responsabilidad clara suele importar más que la longitud del prompt.
Cómo escribir un prompt de transferencia de movimiento para MiniMax H3
Un buen prompt de transferencia de movimiento de MiniMax H3 debe facilitar la interpretación de las relaciones entre referencias. Los principios de una guía más amplia de prompts de MiniMax H3 cobran especial importancia cuando varias referencias necesitan funciones distintas.
Usa referencia, función, conservación y objetivo
Un prompt práctico puede decir simplemente:
El vídeo 1 es la referencia de movimiento. La imagen 1 es la referencia del personaje. El personaje de la imagen 1 realiza el movimiento y sigue los tiempos del vídeo 1. Conserva la identidad, el peinado, el aspecto corporal y la ropa del personaje. Sitúalo en un estudio fotográfico con iluminación suave.
Esto contiene cuatro capas útiles: referencia, función, conservación y objetivo.
No vuelvas a controlar lo que ya controla la referencia
Los prompts detallados pueden ayudar cuando hay ambigüedad entre varios personajes o referencias. Pero más largo no significa automáticamente mejor.
La transferencia de cámara es un buen ejemplo. Si el vídeo 1 ya contiene la trayectoria deseada, describir de nuevo la misma órbita, velocidad, distancia y dirección puede introducir instrucciones que compiten entre sí.
Usa el texto para resolver dudas, no para duplicar información clara de la referencia.
Cómo reemplazar personajes con MiniMax H3 Ref2V
El reemplazo de personajes es una de las aplicaciones más claras de H3, porque movimiento e identidad pueden proceder de fuentes distintas.
Reemplazo de un personaje y encuadre de referencia
Adapta la referencia a la interpretación deseada. Usa una imagen de cuerpo entero para movimientos de todo el cuerpo y un primer plano para la actuación facial.
Después evalúa por separado estos aspectos del resultado:
- identidad;
- ropa;
- tiempos del movimiento;
- cámara;
- entorno.
Un resultado visualmente atractivo puede seguir fallando si cambia el rostro o parte del intérprete original continúa visible.
Caso práctico de reemplazo de dos personajes
Un flujo documentado utilizó un vídeo de baile de dos personas de 10 segundos junto con dos imágenes de personajes separadas. El objetivo era sustituir a ambos intérpretes conservando el movimiento y el entorno originales.
Tras refinar las instrucciones de conservación, el flujo reportó aproximadamente un 90 % de reemplazos correctos en esa configuración concreta, aunque los cambios de semilla seguían influyendo en el resultado.

No es una tasa general de precisión de H3. Demuestra algo más útil: la asignación de referencias para varios personajes es viable, pero sigue siendo probabilística, no determinista.
Cómo cambiar el fondo sin romper la transferencia de movimiento de MiniMax H3
Cambiar personaje, movimiento y entorno en una misma generación crea más condiciones que compiten entre sí.
Cuándo se vuelve inestable Ref2V en una sola pasada
Acciones amplias como caminar, girarse o hacer gestos sencillos pueden conservarse al cambiar a la vez el personaje y el fondo.
Los movimientos finos de los dedos, la interpretación facial, el movimiento de labios y las coreografías complejas son más sensibles. Nuestra revisión encontró que estos detalles tendían más a desviarse al añadir el reemplazo del entorno en la misma pasada.
Usa dos pasadas para movimientos complejos y cambios de fondo
Para planos difíciles:
- Reemplaza al personaje conservando el movimiento y el entorno originales.
- Comprueba identidad, manos, rostro y tiempos.
- Usa el resultado satisfactorio como la siguiente referencia de vídeo.
- Reemplaza el fondo en la segunda generación.
Cuando varias transformaciones compiten, separarlas puede mejorar el control más que ampliar el prompt.
Cómo transferir movimientos de cámara e interpretación facial en MiniMax H3
La transferencia de movimiento no se limita al cuerpo. Las referencias de vídeo también pueden aportar trayectorias de cámara e interpretación.
Transferencia de cámara en MiniMax H3
Cuando la referencia ya aporta el movimiento de cámara, deja que el vídeo lo controle y usa el prompt para definir el nuevo sujeto y el entorno.
Así evitas que dos fuentes controlen independientemente el mismo comportamiento de cámara.
Para transferir la cámara, describe lo nuevo en el plano en lugar de reescribir innecesariamente cómo se mueve ya la cámara de referencia.
Transferencia de expresiones faciales e interpretación en MiniMax H3
La interpretación facial funciona mejor cuando la referencia permite leer movimientos sutiles. Los primeros planos cerrados aportan más información útil sobre los ojos, las cejas, los cambios de expresión y los tiempos de los gestos que los planos generales.
La geometría corporal también importa. Aplicar movimientos humanos a un personaje con proporciones muy diferentes, especialmente a un sujeto de cuatro patas, exige más interpretación y aumenta la probabilidad de desviaciones.
Cómo mejorar la coherencia de personajes en MiniMax H3
La coherencia de los personajes depende tanto del diseño de las referencias como del diseño del prompt.
Ajusta el encuadre de la referencia al plano deseado
Un flujo documentado de coherencia utilizó dos referencias de personaje de medio cuerpo de 1024 × 1024 y generó a 1376 × 768 combinando referencias de personaje y voz. Se observó mayor coherencia facial cuando los rostros aparecían más cerca de la cámara.
La lección práctica es que preservar la identidad es, en parte, un problema cinematográfico. H3 necesita suficiente información visible para resolver los rasgos distintivos.
La resolución de las imágenes de referencia implica compromisos
Otro flujo reportó mayor parecido al aumentar el tamaño efectivo de la imagen de referencia. Las referencias con el lado más largo de unos 2500 píxeles o menos seguían siendo prácticas en esa configuración, mientras que las imágenes de más de 4K resultaban mucho más lentas.
Eso no demuestra que todos los flujos deban maximizar la resolución. La evidencia más sólida respalda un buen encuadre e información de identidad legible, no una coincidencia estricta de píxeles o relación de aspecto.
Cómo afectan la resolución y el cómputo a MiniMax H3 Ref2V
Una resolución mayor puede cambiar más que la nitidez. También puede afectar al seguimiento del prompt, la coherencia de identidad y el coste de generación.
352p, 416p y 768p pueden comportarse de forma distinta
En un flujo controlado de Ref2VA con hardware de 4× B300, el mismo prompt conservó la estructura del plano, el ángulo de cámara y la ubicación de los personajes con mayor coherencia a 352p y 416p que a 768p.
Aumentar los pasos de muestreo mejoró la coherencia visual, pero no recuperó por completo el control estructural. Otros flujos documentados produjeron resultados distintos, por lo que esto no debe tratarse como una regla universal de resolución.

Una resolución mayor no implica automáticamente una mayor fidelidad a las referencias.
Ref2V puede seguir siendo costoso con hardware de gama alta
Un flujo V2V complejo con una RTX PRO 6000 Blackwell con 96 GB de VRAM y 128 GB de DDR5, a unos 0,4 MP y 20 pasos, reportó aproximadamente 2–10 minutos para tomas de 3–10 segundos.
Para los equipos de producción, lo eficiente es validar la asignación de referencias, la identidad y el movimiento con ajustes de menor coste antes de generar a la resolución final.

Cómo gestiona H3 el audio y la continuación de vídeos largos
El audio y la continuidad plantean dos problemas adicionales de control de referencias que es fácil pasar por alto.
Una referencia de voz en H3 no equivale a conservar el habla exacta
Nuestra revisión encontró flujos en los que el habla de referencia se volvía a sintetizar en lugar de copiarse exactamente. En un caso documentado, una diferencia de sincronización de unos 0,1 segundos entre el vídeo y el audio de referencia podía contribuir a omitir palabras o cambiar la entonación.
La distinción importante es sencilla:
Una referencia de voz no equivale a conservar la forma de onda exacta.
Por tanto, los flujos en los que el diálogo es crucial deben tratar el audio original como un recurso de producción independiente.
La continuación de vídeos largos en H3 funciona mejor encadenando clips
Un flujo documentado de continuación generaba clips de 10 segundos y reutilizaba los últimos 2 segundos, o 48 fotogramas a 24 fps, como contexto para la siguiente generación, reintroduciendo las referencias de personaje.

Esto mejoró la continuidad del movimiento, aunque todavía podían producirse desviaciones de color y cambios ocasionales de estado.
Para secuencias más largas, los clips cortos con continuidad de contexto son más prácticos que suponer que una generación conservará todo indefinidamente.
Buenas prácticas de transferencia de movimiento en MiniMax H3
Para producción, estas decisiones ofrecen el punto de partida más claro:
Escenario | Enfoque recomendado | Motivo |
|---|---|---|
Cambio sencillo de personaje | Ref2V en una pasada | Menos cambios en conflicto |
Movimiento fino y fondo nuevo | Dos pasadas | Protege el movimiento sutil |
Transferencia de cámara | Deja la cámara al vídeo | Reduce conflictos de texto |
Interpretación facial | Referencias en primer plano | Interpretación más legible |
Resultado final de alta resolución | Prueba primero con menor coste | Ahorra cómputo |
Secuencias largas | Encadena clips cortos | Mejor control del contexto |
El principio general se mantiene: usa referencias limpias, adapta el encuadre a la interpretación deseada, asigna una función clara a cada fuente y separa las transformaciones cuando la fidelidad empiece a caer.
Preguntas frecuentes
¿Cómo consigo que H3 copie solo el movimiento sin copiar a la persona original?
Usa el vídeo específicamente como fuente de movimiento y asigna la identidad a una imagen de referencia. Indica con claridad qué debe conservarse de la imagen y qué debe transferirse del vídeo. Si sigue apareciendo el intérprete original, simplifica la fuente y reduce las señales de identidad en conflicto.
¿Por qué el reemplazo de personajes en H3 a veces conserva al personaje original o cambia el fondo?
Puede que el vídeo esté influyendo en la identidad o el entorno además del movimiento. Referencias más limpias, encuadres compatibles, funciones explícitas y separar el reemplazo de personajes del cambio de fondo pueden reducir esta filtración.
¿Debo usar Ref2V en una o dos pasadas?
Empieza con una pasada para movimientos sencillos. Usa dos cuando deban mantenerse precisos los movimientos finos de manos, la interpretación facial, los labios, las coreografías complejas y el cambio de fondo. Primero fija personaje y movimiento; después cambia el entorno.
¿Puede H3 conservar exactamente el habla de un vídeo de referencia?
No de forma fiable según los flujos revisados aquí. El habla puede volver a sintetizarse, alterarse o perder precisión al cambiar los tiempos. Si el diálogo exacto importa, conserva el audio de origen por separado en lugar de asumir que Ref2V lo reproducirá sin cambios.
Conclusión
La transferencia de movimiento de MiniMax H3 se vuelve mucho más controlable al tratarla como una arquitectura de referencias multimodales y no como un simple efecto V2V. Los flujos más sólidos asignan identidad, movimiento, cámara, interpretación, entorno y audio a fuentes explícitas; minimizan instrucciones en conflicto; usan referencias adaptadas al plano previsto; prueban de forma eficiente antes de aumentar la resolución; y dividen transformaciones complejas en varias pasadas cuando hace falta. La pregunta más útil deja de ser «¿Cómo escribo un prompt de H3 más largo?» y pasa a ser «¿Qué referencia debería controlar cada parte de este plano?»
Autor: Yifan Zhao — estratega de flujos de diseño con IA y asesor en tecnología creativa.
Más del blog de Virse
Flujo de trabajo

GPT Image 2.5 Noise and Oversharpening: Why Some Images Still Look AI-Generated
9 de octubre de 2026 by Yifan Zhao
Flujo de trabajo

GPT Image 2.5 Keeps Changing My Image: How to Use a "Keep List" for Reliable Edits
9 de octubre de 2026 by Yifan Zhao
Flujo de trabajo

GPT Image 2.5 Editing Drift: Why Images Get Blurry, Cropped or Worse After Multiple Edits
9 de octubre de 2026 by Yifan Zhao