Como substituir um personagem em vídeo com o MiniMax H3 sem alterar a identidade
Vincent13 min de leitura ·

Para substituir um personagem em vídeo com o MiniMax H3 sem alterações de identidade, use a imagem de referência como fonte de identidade e o vídeo original como fonte da atuação. Uma regra simples é: imagem = identidade, vídeo = atuação, prompt = restrições. Isso ajuda o H3 a preservar o rosto e a aparência do novo personagem enquanto mantém movimento, sincronização, pose e comportamento de câmera originais.
O principal desafio é a alteração da identidade. Um personagem pode parecer correto no início e depois se aproximar do intérprete original; movimento rápido, oclusões, clipes longos ou referências conflitantes podem piorar a consistência. Nossa análise do MiniMax H3 sobre fluxos documentados inclui um estudo de seis horas com mais de 400 gerações, além de testes com vários personagens, movimentos intensos, enquadramento e ComfyUI local. Nesses casos, papéis claros para referências, clipes de teste curtos, âncoras fortes de identidade e regras explícitas de preservação aparecem consistentemente como os princípios mais úteis.
Para equipes criativas que gerenciam fluxos de IA com muitas referências como este, o Virse oferece uma forma mais estruturada de organizar o processo. Em vez de forçar cada decisão em uma caixa de conversa, o Virse trabalha em uma tela infinita onde referências, resultados e relações criativas permanecem visíveis, enquanto vários Agents podem trabalhar no mesmo projeto e compartilhar contexto. Com memória de longo prazo para preferências da equipe, padrões da marca e conhecimento do projeto, o Virse ajuda designers profissionais a iterar e ampliar a produção assistida por IA sem abrir mão do controle criativo. MiniMax H3, Seedance 2.5 e Seedance 2.0 já estão disponíveis no Virse, permitindo explorar e comparar vários modelos de vídeo de destaque no mesmo fluxo criativo.

Como funciona a substituição de personagens no MiniMax H3?
Substituir personagens com H3 vai além de trocar rostos
Uma troca de rosto tradicional altera principalmente a aparência facial. O MiniMax H3 pode oferecer geração e edição de imagens mais amplas, nas quais rosto, penteado, roupa, cores, silhueta e identidade corporal mudam enquanto o movimento e a cinematografia originais permanecem.
O modelo mais útil é simples:
Imagem = identidade. Vídeo = atuação. Prompt = atribuição e restrições.
A imagem indica como o novo personagem deve parecer. O vídeo indica como ele deve se mover, atuar e interagir com a cena.
Essa distinção explica falhas comuns. Em fluxos documentados, alguns resultados mudaram cabelo ou roupa, mas conservaram demais o rosto original. Outros preservaram tanto o vídeo de origem que a substituição solicitada quase não aconteceu.
Referências de imagem, vídeo e áudio precisam de papéis claros
A qualidade das referências importa mais que a quantidade.
Entrada | Melhor função |
Imagem do personagem | Rosto, cabelo, roupa, proporções, identidade |
Vídeo de origem | Movimento, pose, expressão, posição, sincronização |
Vídeo de origem | Câmera, enquadramento, iluminação, cena, oclusão |
Referência de áudio | Voz, tom ou contexto de áudio quando necessário |
Prompt | Define substituição, herança e preservação |
O objetivo não é preencher todos os espaços de referência disponíveis, mas fazer cada referência responsável por um tipo claro de informação.
Como preparar a melhor referência de personagem para o MiniMax H3
Use um bom retrato antes de adicionar imagens
Para closes e planos médios, um retrato claro costuma ser o melhor ponto de partida.
Nossa análise encontrou fluxos nos quais reduzir o número de imagens de referência melhorou a precisão da identidade. Imagens extras podem introduzir pequenas contradições em penteado, estrutura facial, figurino, iluminação ou proporções.
Uma boa primeira referência deve oferecer:
- rosto claramente visível
- penteado reconhecível
- roupa consistente
- mínima obstrução
- detalhes faciais suficientes para fixar a identidade
Adicione outra vista apenas quando ela resolver uma falta específica de informação.
Use uma prancha de personagem para movimentos de corpo inteiro e giros
Um único retrato se torna menos útil quando o intérprete gira, aparece de perfil ou vira de costas para a câmera.
Para esses clipes, uma prancha com vista frontal, traseira e close do rosto pode fornecer cobertura melhor. Isso é especialmente útil para penteados, jaquetas, calçados ou figurinos marcantes que devem permanecer coerentes durante a transferência de movimento e os giros.
Do ponto de vista do design, isso funciona como uma folha tradicional de vistas de personagem: o modelo recebe a informação visual antes de aquela vista aparecer em movimento.
Ajuste o enquadramento da referência ao plano desejado
O enquadramento é uma variável frequentemente esquecida.
Um fluxo documentado melhorou a consistência após adaptar a referência para aproximadamente 864 × 480, mais perto da composição desejada. Em outro caso, um PNG de corpo inteiro de 848 × 1264 foi usado com um clipe de origem de 1280 × 720, 30 fps e 14,4 segundos, mas ainda houve alterações visíveis de identidade.
Não são benchmarks controlados, mas sustentam uma regra prática: torne os traços que definem a identidade grandes e claros o suficiente para a escala do personagem no plano final.

Como substituir um personagem em vídeo com o MiniMax H3 passo a passo
Etapa 1: faça do vídeo de origem a referência principal da atuação
Deixe o vídeo de origem controlar movimento, pose, posição, rotação corporal, atuação facial, velocidade, sincronização e coreografia.
Não reescreva cada movimento se o vídeo de origem já contém a atuação desejada. Descrever a ação novamente pode criar outra camada de interpretação, em vez de melhorar a fidelidade.
Etapa 2: defina a imagem de referência como fonte de identidade
Diga claramente que o intérprete original deve ser substituído pelo personagem da referência.
Defina os atributos visuais que devem permanecer estáveis, incluindo rosto, penteado, roupa, cores, proporções e detalhes distintivos.
Em um estudo documentado com mais de 400 gerações em aproximadamente seis horas, definições fracas do sujeito foram associadas à perda de identidade em cerca da metade de algumas rodadas de teste. A lição não é que todo fluxo se comportará assim, mas que rótulos vagos de identidade são arriscados quando a consistência importa.
Etapa 3: transfira a atuação original
O personagem substituto deve herdar do intérprete original movimento, pose, posição, expressão, rotação, velocidade e sincronização.
Essa instrução é essencial porque informa ao H3 que o intérprete de origem fornece a atuação, não a identidade
Etapa 4: preserve câmera, iluminação e estrutura da cena
Proteja tudo que estiver fora da edição pretendida do personagem.
Preserve fundo, objetos de cena, trajetória da câmera, enquadramento, foco, desfoque de movimento, iluminação, sombras, composição e sincronização da edição.
Quanto menos elementos não relacionados o H3 precisar redesenhar, mais fácil será concentrar a capacidade do modelo na substituição.
Etapa 5: preserve as oclusões
As oclusões importam quando mãos, cabelo, objetos, armas, roupas ou outros personagens passam na frente do sujeito.
Se uma mão passa diante do rosto no original, deve passar diante do rosto substituto no mesmo instante. Isso também vale para arcos, equipamentos, objetos em primeiro plano e sobreposição de personagens.
Isso é especialmente importante em dança, corrida, boxe, tiro com arco, giros rápidos e cenas de ação.
Qual é o melhor prompt de troca de personagem no MiniMax H3?
Use Substituir, Corresponder, Herdar, Preservar e Impedir
A estrutura geral de prompt mais forte é:
Substituir: substitua o intérprete original pelo personagem de referência.
Corresponder: reproduza rosto, cabelo, roupa, cores, proporções e detalhes reconhecíveis da identidade do personagem.
Herdar: preserve movimento, pose, expressão, posição, velocidade, rotação e sincronização do intérprete original.
Preservar: mantenha câmera, fundo, iluminação, sombras, objetos, enquadramento, foco e edição originais.
Impedir: não introduza novas ações, objetos, cortes, movimentos de câmera, texto ou acessórios.
Assim, um prompt de produção conciso pode ser:
No Vídeo 1, substitua o intérprete original pelo personagem da Imagem 1. Reproduza o rosto, penteado, roupa, cores, proporções corporais e detalhes visíveis de identidade da referência durante todo o clipe. Preserve movimento, pose, posição, rotação, expressão, velocidade e sincronização do intérprete original. Mantenha fundo, objetos de cena, trajetória da câmera, enquadramento, foco, desfoque de movimento, iluminação, sombras, composição e edição inalterados. Preserve as relações originais de oclusão quando mãos, cabelo, roupas ou objetos passarem na frente do personagem. Não adicione novas ações, objetos, movimentos de câmera, cortes, texto ou acessórios.
Prompts simples podem superar os excessivamente estruturados
Prompts mais longos não são automaticamente mais controláveis.
Em um fluxo documentado de substituição de cabeça, uma instrução simplificada gerou bons resultados em cerca de 70% das tentativas, enquanto uma versão mais elaborada às vezes preservava tanto do original que quase não havia substituição.
Estruturar o prompt é mais útil quando resolve um problema específico, como mapeamento de vários personagens, alteração persistente de identidade ou referências conflitantes.
Como corrigir alterações de identidade no MiniMax H3
Comece com clipes curtos antes de aumentar a duração
A alteração de identidade costuma aparecer aos poucos. O personagem pode começar correto, aproximar-se do intérprete original e depois se recuperar parcialmente.
Um teste de 14,4 segundos, 1280 × 720 e 30 fps com uma referência de corpo inteiro de 848 × 1264 ainda mostrou alterações significativas em um fluxo com RTX 5070 Ti de 16GB.
Uma ordem mais eficiente para diagnosticar é:
- Teste aproximadamente cinco segundos.
- Reforce a referência facial.
- Ajuste melhor o enquadramento.
- Remova referências desnecessárias.
- Esclareça os papéis de identidade e atuação.
- Adicione uma vista traseira para os giros.
- Teste outra semente.
- Aumente a qualidade para movimentos difíceis.
Movimentos intensos podem exigir configurações mais conservadoras
No fluxo com mais de 400 gerações, clipes de cinco segundos eram comuns nos testes, com experimentos adicionais de 15 segundos.
Turbo de quatro passos foi útil para iterar, mas movimentos difíceis às vezes perdiam consistência de identidade. Para sequências mais difíceis, esse fluxo voltou a cerca de 20 passos.

Não é uma configuração universal. Isso ilustra uma troca mais ampla: gerar mais rápido pode ser menos confiável quando o modelo precisa resolver identidade, pose, movimento, oclusão e continuidade temporal ao mesmo tempo.

Mantenha a identidade do personagem H3 entre cortes e vídeos longos
Sequências longas e cortes secos criam mais oportunidades para a identidade original reaparecer ou para referências competirem.
Na produção, valide a substituição em segmentos curtos revisados individualmente antes de estender a sequência. Mantenha a mesma descrição de identidade e o mesmo mapeamento de referências entre clipes, verificando a continuidade em cada corte.
Não presuma que um personagem correto no primeiro plano continuará dominante automaticamente nos seguintes. A consistência entre clipes deve ser uma tarefa explícita de produção, não uma decisão única de prompt.
Como substituir vários personagens com o MiniMax H3
Mapeie cada personagem explicitamente
Para substituir duas pessoas, cada identidade precisa de um mapeamento estável.
Uma estrutura prática é:
- A Imagem 1 define o Personagem A
- A Imagem 2 define o Personagem B
- O Vídeo 1 fornece as duas atuações
- O Personagem A substitui o intérprete à esquerda
- O Personagem B substitui o intérprete à direita
Um fluxo documentado com dois personagens alcançou cerca de 90% de sucesso relatado após melhorar mapeamento e retenção dos sujeitos, embora os resultados ainda dependessem da semente.

Evite misturar identidades nos cruzamentos
Os momentos mais difíceis ocorrem quando intérpretes cruzam posições, se sobrepõem ou bloqueiam uns aos outros.
Atribuir claramente Personagem A e Personagem B é mais seguro que usar rótulos vagos como primeira e segunda pessoa.
Com vários personagens, a clareza do papel das referências vale mais que usar o número máximo delas.
O que mostram os testes de desempenho do MiniMax H3 no ComfyUI?
12GB de VRAM podem funcionar com grandes concessões
Um fluxo com RTX 3060 de 12GB relatou aproximadamente:
- 5 segundos em cerca de 2MP
- 8 segundos em cerca de 1,34MP
- cerca de 25 minutos para a geração de 1,34MP
Outro teste de 12GB usou nove referências PNG HD em 0,4MP. Uma geração normal de imagem para vídeo de 30 segundos levou cerca de 14 minutos, enquanto o fluxo Ref2V multirreferência levou cerca de 20 minutos.
São exemplos de fluxos, não benchmarks universais, mas mostram a relação entre duração, resolução, número de referências e custo de geração.

Mais VRAM não corrige automaticamente alterações de identidade
Um fluxo de 16GB ainda apresentou alterações em um clipe de substituição mais longo.
Um teste com RTX 3090 Ti de 24GB usando 56 quadros em 0,5MP descreveu a edição de vídeo como aproximadamente duas vezes mais exigente que a geração mais simples por referência de imagem.
Um fluxo otimizado de ponta com 5090 relatou mais de 10GB de economia de VRAM e cerca de 14GB a menos de memória compartilhada da GPU após trocar para componentes mais eficientes, com velocidade de geração aproximadamente igual.
O ponto central é que a capacidade da GPU afeta as configurações possíveis, mas qualidade das referências, duração, complexidade do movimento e estrutura do prompt continuam determinando a estabilidade da identidade.

Quais são os erros mais comuns na troca de personagens com MiniMax H3?
Adicionar referências antes de diagnosticar a falha
Mais referências podem criar mais contradições.
Comece com uma fonte de identidade forte. Adicione outra vista apenas quando o clipe revelar informações que a primeira imagem não fornece.
Testar vídeos longos cedo demais
Um clipe de ação de 15 segundos que falhou pode ter várias causas.
Um teste de cinco segundos facilita isolar problemas de identidade, enquadramento, movimento, semente, resolução ou oclusão antes de gastar mais processamento.
Mudar elementos demais ao mesmo tempo
Se a tarefa é substituir personagens, evite mudar simultaneamente fundo, iluminação, câmera, animação e estilo de edição.
Os fluxos profissionais de vídeo com IA ficam mais controláveis quando cada geração tem um limite estreito de transformação.
Perguntas frequentes
Por que o H3 mantém o rosto original?
As causas mais comuns são referências fracas de identidade, papéis ambíguos, enquadramento incompatível, referências em excesso ou instruções de preservação que anulam a edição. Comece com um retrato claro, atribua identidade à imagem e atuação ao vídeo, validando a substituição em um clipe curto antes de aumentar a complexidade.
O H3 pode substituir dois personagens ao mesmo tempo?
Sim. A substituição múltipla pode funcionar quando cada referência é mapeada explicitamente para um intérprete. O principal desafio é misturar identidades quando personagens se sobrepõem, cruzam posições ou se bloqueiam. Mapeamentos estáveis A e B são mais confiáveis que descrições vagas de posição.
Quantas imagens de referência devo usar com o H3?
Comece com uma imagem forte. Adicione outra vista apenas se o vídeo revelar informações ausentes na primeira, como cabelo ou figurino por trás. Em vários fluxos documentados, menos referências melhoraram a consistência porque o modelo precisava conciliar menos sinais visuais conflitantes.
De quanta VRAM o H3 precisa?
Não há um requisito fixo único. Fluxos locais documentados incluem casos funcionais com GPUs de 12GB, 16GB e 24GB, mas resolução, duração, passos, quantização, configuração do modelo e número de referências afetam a memória. Em hardware limitado, reduza primeiro a duração e a resolução.
Conclusão
O melhor fluxo de substituição de personagens no MiniMax H3 não gira em torno de um “prompt definitivo”. Ele atribui a responsabilidade certa a cada fonte: a imagem define a identidade, o vídeo original define atuação e cinematografia, e o prompt define o que deve mudar, ser transferido e permanecer intacto. Em centenas de gerações documentadas, casos com vários personagens, testes de movimentos intensos, experimentos de enquadramento e fluxos locais de GPU, o padrão mais forte é consistente: comece com um clipe curto, use o mínimo de referências fortes, separe identidade de atuação, preserve câmera e oclusões explicitamente e adicione complexidade apenas quando uma falha específica exigir.
Mais do blogue da Virse
Fluxo de trabalho

GPT Image 2.5 Noise and Oversharpening: Why Some Images Still Look AI-Generated
9 de outubro de 2026 by Yifan Zhao
Fluxo de trabalho

GPT Image 2.5 Keeps Changing My Image: How to Use a "Keep List" for Reliable Edits
9 de outubro de 2026 by Yifan Zhao
Fluxo de trabalho

GPT Image 2.5 Editing Drift: Why Images Get Blurry, Cropped or Worse After Multiple Edits
9 de outubro de 2026 by Yifan Zhao