Guia de referências do MiniMax H3: imagens, vídeo e áudio explicados
Yifan Zhao12 min de leitura ·

As referências do MiniMax H3 permitem controlar a aparência, o movimento e o som de um vídeo usando diferentes recursos de origem. Imagens são mais adequadas para identidade, figurino, produtos e ambientes; vídeos, para movimento, atuação, comportamento da câmera e ritmo; áudio, para timbre vocal, música, ritmo e características sonoras. Esses controles são especialmente importantes na transferência de movimento do MiniMax H3, em que referências distintas podem cuidar separadamente da identidade, do movimento, da câmera e do som.
O desafio é impedir que essas referências compitam. Um vídeo de movimento pode deixar vazar aparência, várias imagens podem disputar a identidade, e o Ref2VA pode trocar nitidez visual por maior flexibilidade de referências. Na prática, os melhores resultados vêm de definir o que cada referência deve preservar, transferir e ignorar antes da geração. Um prompt estruturado do MiniMax H3 e um fluxo repetível do MiniMax H3 facilitam o controle dessas responsabilidades.
Para equipes que ampliam esses fluxos, o Virse reúne referências, recursos e vários Agentes de IA em uma tela infinita com contexto criativo compartilhado e memória visual de longo prazo. O Virse oferece acesso a mais de 50 modelos em uma tela, incluindo Nano Banana 2, GPT Image 2 e Seedance 2.0, ajudando a transformar a geração guiada por referências em um fluxo de design com IA mais amplo. Novos usuários podem começar com créditos gratuitos, enquanto os planos pagos liberam modelos premium e uso ilimitado de determinados modelos rápidos para fluxos de produção maiores.

O que são as referências do MiniMax H3 e como funcionam?
Uma referência do MiniMax H3 é uma imagem, um vídeo ou um áudio usado para fornecer atributos específicos a uma nova geração. A maneira mais confiável de usar o H3 é pensar na responsabilidade da referência, e não no tipo de arquivo.
Referência | Ideal para | Função típica |
|---|---|---|
Imagem | Aparência estável | Identidade, figurino, produto, ambiente |
Imagem de ancoragem | Estado visual específico | Composição, enquadramento, estado inicial ou final |
Vídeo | Comportamento temporal | Movimento, atuação, câmera, ritmo |
Áudio | Características sonoras | Voz, música, ritmo, textura |
Um mapa simples de produção pode atribuir a imagem 1 à identidade, a imagem 2 ao figurino, o vídeo 1 à coreografia, o vídeo 2 ao movimento de câmera e o áudio 1 ao timbre vocal. A abordagem “uma referência, uma tarefa principal” não é uma restrição técnica, mas uma maneira prática de reduzir a ambiguidade.
Limites de referências do MiniMax H3
As especificações oficiais do H3 também importam ao planejar um fluxo.
Entrada ou saída | Limite |
|---|---|
Imagens de referência | Até 9 |
Vídeos de referência | Até 3, com 2–15 segundos cada, 15 segundos no total |
Áudio de referência | Até 3, com 2–15 segundos cada, 15 segundos no total |
Arquivos de referência combinados | Até 12 |
Entrada Ref2VA apenas de áudio | Não suportada |
Duração da saída | 4–15 segundos |
Taxa de quadros da saída | 24 FPS |
Áudio nativo | Estéreo de 32 kHz |
A implicação prática é simples: há mais referências disponíveis do que a maioria dos projetos deveria realmente usar. Comece com o menor conjunto que defina claramente o plano.

Como as referências de imagem do MiniMax H3 controlam identidade e aparência?
Uma referência de imagem do MiniMax H3 é ideal para atributos que devem permanecer visualmente reconhecíveis entre quadros, incluindo rosto, penteado, figurino, geometria do produto, materiais, ambiente e estilo visual.
Referências de sujeito e imagens de ancoragem no MiniMax H3
Uma referência de sujeito representa uma pessoa ou um objeto reutilizável. Uma imagem de ancoragem se aproxima mais de uma composição ou de um estado visual concreto.
Use uma referência orientada ao sujeito quando o requisito for “mantenha este personagem ou produto”. Use um fluxo orientado ao quadro quando o requisito for “comece ou termine nesta imagem específica”.
Consistência de personagens e produtos
Para personagens, uma referência de identidade limpa costuma ser mais útil do que vários retratos inconsistentes. Conflitos de cabelo, idade, roupas ou proporções podem enfraquecer a preservação da identidade.
Produtos exigem restrições ainda mais rigorosas. Um plano cinematográfico continua inutilizável se o logotipo se mover ou a silhueta mudar. Em trabalhos de marca, preserve explicitamente proporções, posição do logotipo, materiais, cores e detalhes estruturais distintivos.
Como as referências de vídeo do MiniMax H3 controlam movimento e câmera?
Referências de vídeo são mais úteis para informações que se desenvolvem ao longo do tempo: movimentos corporais, coreografia, atuação, tempo dos gestos, trajetórias de câmera, ritmo, cortes e ritmo de edição.
Transferência de identidade e atuação no MiniMax H3
Um dos padrões mais eficazes de Ref2VA é:
A imagem A define quem é o personagem. O vídeo B define o que ele faz.
Um fluxo de moda, por exemplo, pode usar uma imagem para identidade, outra para roupas, um vídeo para a caminhada e outro para o movimento de câmera. Isso separa identidade visual e movimento, em vez de pedir a um único prompt que invente ambos.
Fluxos de referências de câmera no MiniMax H3
O vídeo também pode definir a câmera em vez do ator. Uma imagem de produto pode preservar a geometria enquanto um vídeo sem relação fornece uma órbita lenta, uma aproximação, um acompanhamento com câmera na mão ou um movimento semelhante ao de uma grua.
Do ponto de vista do design, isso importa porque a linguagem da câmera faz parte da direção criativa. O mesmo produto pode parecer sofisticado, enérgico ou documental, dependendo do movimento do plano.
Por que “apenas movimento” ainda pode deixar vazar aparência
“Use este vídeo apenas para o movimento” é uma instrução, não um limite perfeito de extração. Roupas, formato corporal, iluminação ou outras características visuais ainda podem vazar da fonte.
Quando isso acontece, a melhor correção inicial costuma ser simplificar as referências, reforçar a fonte de identidade desejada e restringir a função do vídeo.
Como funcionam as referências de áudio do MiniMax H3?
O H3 pode gerar áudio e vídeo conjuntamente, tornando o som parte do sistema criativo, e não apenas uma camada de pós-produção.
As referências de áudio podem influenciar timbre vocal, forma de falar, música, ritmo, estrutura da trilha sonora, efeitos sonoros e textura do som.
Reutilização e referência de áudio no MiniMax H3
Reutilizar áudio significa preservar todo ou parte de um sinal existente. Usar áudio como referência significa aproveitar características permitindo que o conteúdo gerado mude.
Essa distinção importa para novos diálogos. Se a fonte deve definir quem fala, e não as palavras, a direção criativa deve enfatizar o timbre vocal e a forma de falar, e não simplesmente reutilizar o áudio original.
Tipos de falhas de áudio do MiniMax H3
Nossa análise de fluxos documentados do H3 encontrou problemas recorrentes, incluindo:
- sílabas repetidas
- fala distorcida
- diálogo parecido com fala sem sentido
- troca de vozes entre personagens
- sincronização labial fraca
- áudio que termina antes da sequência visual
Um fluxo documentado do Spectrum com 20 etapas usou 11 avaliações reais do transformer e previu nove etapas intermediárias, reduzindo o trabalho do amostrador em cerca de 45%. O mesmo fluxo também produziu áudio mais áspero e sílabas repetidas.
A lição para a produção é importante: uma otimização que preserve quadros aceitáveis ainda pode prejudicar o diálogo.
FL2VA ou Ref2VA no MiniMax H3: qual usar?
FL2VA e Ref2VA resolvem problemas de controle diferentes.
Requisito | Melhor escolha |
|---|---|
Controle exato do primeiro quadro | FL2VA |
Controle exato do último quadro | FL2VA |
Personagem e movimento | Ref2VA |
Personagem e câmera | Ref2VA |
Várias imagens de referência | Ref2VA |
Referência de áudio | Ref2VA |
Composição multimodal complexa | Ref2VA |
Use FL2VA quando o próprio quadro for a restrição principal. Use Ref2VA quando atributos diferentes precisarem vir de referências distintas.
Quando o FL2VA é mais adequado
O FL2VA costuma ser a opção mais simples quando você já tem um visual principal projetado, um quadro de storyboard ou um estado final obrigatório. Se o controle com várias referências não acrescenta valor criativo real, o Ref2VA pode introduzir complexidade desnecessária.
Quando o Ref2VA é mais adequado
O Ref2VA é mais forte quando o plano combina identidade, figurino, movimento, câmera e som de fontes diferentes.
Nos fluxos da nossa pesquisa, menor nitidez, granulação adicional e menos detalhes percebidos foram preocupações recorrentes com o Ref2VA. Essas observações não são um benchmark controlado com a mesma semente, mas revelam uma escolha útil: um controle mais profundo das referências pode custar fidelidade visual percebida.
Como combinar várias referências do MiniMax H3 sem conflitos?
Um fluxo confiável com várias referências começa com três perguntas:
O que deve permanecer igual? O que deve ser transferido? O que deve ser ignorado?
Para um vídeo de personagem:
- Preservar: rosto, penteado, figurino
- Transferir: coreografia, trajetória de câmera, características da voz
- Ignorar: identidade do intérprete original, roupas indesejadas, detalhes irrelevantes do fundo
Para um anúncio de produto:
Variável criativa | Fonte |
|---|---|
Geometria do produto | Imagem do produto |
Ator | Imagem do personagem |
Ambiente | Imagem do local |
Câmera | Referência de vídeo |
Voz ou toque sonoro | Referência de áudio |
Ritmo temporal | Prompt |
Antes de renderizar, verifique se duas referências definem o mesmo atributo de formas diferentes. Remover uma referência conflitante costuma melhorar o controle mais do que acrescentar texto ao prompt.
Como escrever um prompt de referências melhor para o MiniMax H3?
Um bom prompt do H3 se lê como um briefing de produção compacto.
Defina as funções das referências e o que preservar
Comece dizendo o que cada fonte controla e depois fixe os detalhes que não podem mudar: rosto, penteado, figurino, formato do produto, logotipo, cor ou material.
Escreva a cena como uma linha do tempo
Prompts de vídeo devem descrever quando as ações acontecem. Um plano de 15 segundos pode primeiro estabelecer a cena, depois introduzir a atuação, adicionar uma órbita de câmera mais tarde e terminar com diálogo.
Isso dá ao H3 uma estrutura temporal e à equipe criativa pontos claros de revisão.
Separe câmera, som e restrições negativas
As instruções de câmera devem descrever como a cena é capturada: órbita, aproximação, movimento com câmera na mão, mudança de foco ou pouca profundidade de campo.
As instruções de som devem definir separadamente quem fala, a referência de voz, a ambiência, a música e o tempo. As restrições negativas devem focar falhas críticas de produção, como alterar um logotipo, herdar o ator errado ou introduzir uma segunda voz.
O objetivo não é um prompt mais longo, mas menos decisões ambíguas.
Quais dados de desempenho do MiniMax H3 importam na prática?
Nossa análise inclui vários fluxos locais. Não são benchmarks padronizados, mas mostram como o custo de iteração pode aumentar rapidamente.
Hardware / fluxo | Resultado relatado |
|---|---|
RTX 4070 Ti SUPER 16 GB | 640×832: 1,63 s em 2 min 09 s; 736×960: 6,58 s em 6 min 55 s |
RTX 6000 PRO 96 GB | 1K: base de 14 s, EasyCache de 8 s; 2K: base de 37 s, EasyCache de 22 s |
Produção longa com RTX 5090 | Cerca de 10 min para um clipe de 15 s com aproximadamente 1,5 MP |
768×1280, 20 etapas | 5 s: 2 min; 10 s: 6 min; 20 s: 20 min; 30 s: 43 min |
A principal lição prática é que gerações mais longas podem se tornar desproporcionalmente caras. Faça rascunhos baratos para validar referências, movimento, enquadramento e semente antes de investir na qualidade final.

O MiniMax H3 pode gerar imagens estáticas?
O H3 também foi usado em fluxos experimentais de imagens estáticas para pôsteres, fichas de personagens, edição de figurino e mudanças de local e de ângulo de câmera. Um fluxo documentado com RTX 5090 no RunPod relatou cerca de oito segundos para editar uma imagem de 1920×1088.
Isso é mais bem entendido como uma adaptação do fluxo, e não como um modo nativo oficial de imagem.
Como manter a consistência de vídeos mais longos do MiniMax H3?
Como a saída nativa dura de 4 a 15 segundos, produções mais longas geralmente exigem continuação por segmentos.
Um fluxo documentado passava cerca de 22 quadros anteriores para a geração seguinte. Outro reutilizava os últimos dois a três segundos de cada seção ao montar um projeto de aproximadamente dois minutos.
Um fluxo prático de produção longa é:
- Gere um clipe curto.
- Selecione a tomada bem-sucedida.
- Preserve o estado visual final.
- Reutilize referências de identidade e figurino.
- Gere o próximo segmento.
- Una os clipes bem-sucedidos.
- Revise separadamente a continuidade de voz, ambiência e música.
Fichas de personagens também ajudam a definir frente, perfil, corpo, penteado, roupas e acessórios em várias vistas.
Boas práticas de referências do MiniMax H3
Para uma produção confiável, reúna estes princípios em uma lista de verificação:
- Atribua uma tarefa principal a cada referência.
- Separe identidade e atuação.
- Remova referências concorrentes antes de complicar o prompt.
- Escreva explicitamente o tempo e os momentos da cena.
- Fixe os atributos críticos de marca, produto e identidade.
- Avalie o áudio separadamente da qualidade visual.
- Faça rascunhos baratos e depois dedique recursos computacionais à versão que vale a pena finalizar.
Esses princípios são mais fáceis de repetir quando fazem parte de um fluxo documentado do MiniMax H3, em vez de serem reinventados a cada geração.
Perguntas frequentes
Por que o Ref2VA fica mais borrado que o FL2VA?
Nossa análise encontrou relatos recorrentes de detalhes mais suaves, mais granulação e menor nitidez percebida em alguns fluxos Ref2VA. Isso não é um benchmark controlado universal. Se você só precisa de forte controle sobre o primeiro ou o último quadro, FL2VA pode ser mais simples; use Ref2VA quando a flexibilidade de várias referências for necessária.
Devo usar FL2VA ou Ref2VA?
Use FL2VA quando o quadro inicial ou final for a restrição dominante. Use Ref2VA quando precisar combinar identidade, roupas, movimento, câmera ou áudio de fontes diferentes. O melhor modo é aquele que introduz menos complexidade de controle desnecessária.
O H3 pode criar vídeos com mais de 15 segundos?
Sim, mas projetos longos geralmente são montados a partir de várias gerações curtas. Fluxos práticos reutilizam quadros finais, segundos de vídeo anteriores, referências de personagem e uma direção sonora consistente para reduzir descontinuidades entre segmentos.
O H3 pode gerar imagens estáticas?
O H3 pode ser usado para gerar e editar imagens estáticas por meio de fluxos experimentais, embora isso não seja o mesmo que um modo nativo oficial de imagem. Usos documentados incluem pôsteres, fichas de personagens, edição de figurino e mudanças de ângulo de câmera.
Conclusão
O MiniMax H3 é mais poderoso quando as referências de imagem, vídeo e áudio são tratadas como fontes separadas de responsabilidade criativa, e não como uma pilha de contexto. Imagens geralmente devem definir a identidade visual estável, vídeos o comportamento temporal, áudio as características sonoras, e o prompt deve explicar como essas fontes interagem. O Ref2VA permite um controle multimodal mais profundo, mas essa flexibilidade pode trazer escolhas entre nitidez, confiabilidade do áudio, consistência e custo computacional. A estratégia mais forte é, portanto, atribuir uma função clara a cada referência, separar identidade e atuação, fixar atributos críticos, estruturar cenas no tempo, validar o áudio de forma independente e iterar com baixo custo antes da renderização final. Para equipes que decidem onde essa abordagem com muitas referências é mais útil, onde usar o MiniMax H3 oferece um próximo passo prático.
Mais do blogue da Virse
Fluxo de trabalho

GPT Image 2.5 Noise and Oversharpening: Why Some Images Still Look AI-Generated
9 de outubro de 2026 by Yifan Zhao
Fluxo de trabalho

GPT Image 2.5 Keeps Changing My Image: How to Use a "Keep List" for Reliable Edits
9 de outubro de 2026 by Yifan Zhao
Fluxo de trabalho

GPT Image 2.5 Editing Drift: Why Images Get Blurry, Cropped or Worse After Multiple Edits
9 de outubro de 2026 by Yifan Zhao