Inferência de oito passos
Renderiza em oito passos de amostragem, configuráveis até um mínimo de um.
Um modelo de 6 mil milhões de parâmetros comprimido num processo de inferência de oito passos, criado para devolver uma imagem utilizável antes de o seu raciocínio avançar.
Abra esta página em um navegador de desktop para começar a criar.
Z-Image Turbo foi construído em torno de uma decisão: comprimir a inferência para oito passos, em vez dos vinte a cinquenta de que um modelo de difusão padrão precisa, e ver quanta qualidade sobrevive.
Bastante, como se verificou. Os pontos fortes publicados são resultado fotorrealista, representação de texto bilingue em inglês e chinês e cumprimento de instruções — nada do que esperaria que um modelo tão pequeno e tão rápido fizesse bem. O que sacrifica é margem de capacidade, não competência.
Use Z-Image Turbo no início do trabalho. Explore uma direção visual, teste se uma ideia é compreensível, preencha uma composição com imagens provisórias e gere o volume de imagens descartáveis que pensar bem realmente exige.

Z-Image Turbo é um modelo de texto para imagem com 6 mil milhões de parâmetros. A sua arquitetura é um transformador de difusão de fluxo único em que tokens de texto, tokens semânticos e tokens de imagem partilham um transformador, em vez de serem processados em ramos separados.
O modelo assenta em três grandes pontos fortes:
O número de passos pode ser configurado até um mínimo de um, e é possível obter latência inferior a um segundo em equipamento de centro de dados. Os pesos são publicados abertamente, embora na Virse funcione como modelo alojado, sem nada para instalar.

Renderiza em oito passos de amostragem, configuráveis até um mínimo de um.
Alcançável em equipamento de centro de dados, que é o alvo de toda a conceção.
Deliberadamente pequeno, de onde vem a velocidade.
Tokens de texto, semânticos e de imagem partilham um transformador, em vez de ramos separados.
Texto em inglês e chinês tratado como linguagem, em vez de decoração.
Renderização realista, em vez de um estilo próprio estilizado.
Oito passos face aos habituais vinte a cinquenta não são um pequeno ajuste, são a arquitetura. Tudo o resto neste modelo decorre da decisão de fazer cada renderização terminar antes de perder o fio à meada.
Seis mil milhões de parâmetros são uma fração dos modelos de topo, mas tanto o fotorrealismo como o cumprimento de instruções se mantêm. A contrapartida revela-se na margem de capacidade, não na competência básica.
Tanto o texto em inglês como em chinês é representado como linguagem legível. Entre modelos rápidos, isso é suficientemente invulgar para importar quando uma composição precisa de uma legenda num dos dois sistemas de escrita.
Quando uma renderização demora menos de um segundo, gerar um conjunto de seis é uma única decisão, em vez de seis.
Uma composição de que goste aqui pode passar diretamente para um modelo de imagem mais pesado como referência ou para um modelo de vídeo como fotograma inicial, sem sair da tela.
O modelo é publicado abertamente, mas na Virse funciona como serviço alojado, sem ambiente para configurar.
Um modelo rápido só é tão útil como o que vem a seguir. Sozinho é uma curiosidade; como primeira etapa de um processo, muda a economia de tudo o que se segue. A Virse torna essa passagem direta. Um resultado gerado aqui pode tornar-se referência para um modelo de topo ou fotograma inicial para um modelo de vídeo sem ser exportado, renomeado e carregado novamente.
Gere trinta direções no tempo que um modelo de topo leva a gerar duas e depois dedique esforço real apenas ao que sobrevive.
Envie a composição que funcionou diretamente para um modelo mais pesado como imagem de referência, na mesma tela.
Alterne entre Z-Image Turbo e mais de 30 outros modelos de imagem e vídeo sem sair da tela nem reescrever o briefing.
As direções rejeitadas ficam dispostas ao lado da escolhida, de onde vem a maioria das ideias da segunda ronda.
Pesquisas visuais amplas no início de um projeto, quando o número de direções importa mais do que o acabamento de qualquer uma.
Construa um painel coerente numa única sessão, em vez de o reunir a partir de resultados de pesquisa.
Preencha uma proposta de design com imagens aproximadamente certas antes de alguém decidir quais serão as reais.
Descubra que formulação produz que resultado antes de gastar tempo a descobri-lo num modelo mais lento.
Itere a baixo custo no fotograma a partir do qual um modelo de vídeo vai começar.
Ritmos de publicação em que cada imagem precisa de ser razoável, em vez de excecional.
Indique o sujeito, o cenário e o tratamento. Briefings longos são desperdiçados a esta velocidade.
Gere seis de uma vez. O lote inteiro regressa em aproximadamente o tempo de uma renderização de um modelo de topo.
Compare composição, paleta e atmosfera. O detalhe fino ainda não é o que está a avaliar.
Leve o prompt que funcionou para um modelo com maior margem de capacidade para a versão que será entregue.
Um prompt útil para Z-Image Turbo costuma incluir três elementos:
Em vez de escrever
Uma figura solitária na beira de uma falésia varrida pelo vento à hora dourada, cabelo captado em pleno movimento, fios individuais a apanhar a luz de contorno, casaco de lã gasto com textura de fibras visível, aves marinhas distantes, raios de luz volumétricos, fotografado a 85 mm e f/1.4.
Escreva
Uma figura na beira de uma falésia ao pôr do sol, vista por trás, plano geral. Luz quente e baixa. Pictórico, cores suaves.
Uma única árvore numa encosta de resto vazia, vista de um ângulo baixo contra um céu encoberto. Plano geral, árvore ligeiramente à direita do centro. Paleta suave de cinzento e verde, fotográfico.
Um mercado de rua urbano à noite. Ilustração plana, paleta limitada de quatro cores, traço preto grosso, sem gradientes. Distribuição uniforme das bancas pelo enquadramento, vistas de frente.
A fachada de uma pequena loja de noodles ao anoitecer, vista de frente do outro lado da rua. Um letreiro horizontal por cima da porta diz NORTHSIDE NOODLES, com 面馆 por baixo a metade do tamanho. Luz quente a sair do interior, pavimento molhado a refleti-la, tratamento fotográfico.
| Dimensão | Z-Image Turbo | Nano Banana Pro |
|---|---|---|
| Parâmetros | 6 mil milhões | Escala de modelo de topo |
| Passos de inferência | 8, configurável para 1 | Processo padrão |
| Objetivo de conceção | Latência | Limite máximo de qualidade |
| Representação de texto | Inglês e chinês, textos curtos | Passagens longas e composições multilingues |
| Tratamento de referências | Orientado por um único prompt | Combinação de várias imagens com funções definidas |
| Onde se enquadra | Exploração e imagens provisórias | Materiais finais, impressão, trabalho para clientes |
Está a observar composição, paleta e atmosfera. O detalhe não está em causa e não deve fazer parte da avaliação.
Variação suficiente para ver um padrão, rapidez suficiente para nunca ponderar se vale a pena.
Além disso, está a descrever coisas que oito passos de inferência não irão resolver.
No momento em que estiver a executar novamente para corrigir pequenos detalhes, mude de modelo, em vez de mudar de prompt.
Quando uma renderização termina antes de acabar de pensar, a limitação deixa de ser o tempo e passa a ser quantos resultados consegue observar de forma útil.