12 langues nativement
Du texte rendu comme du langage plutôt que comme une décoration en forme de caractères.
Qwen Image 3.0 Pro d’Alibaba rend le texte comme du langage dans une douzaine de systèmes d’écriture, en maintenant sa lisibilité jusqu’à dix pixels dans les compositions denses.
Ouvrez cette page sur un navigateur de bureau pour commencer à créer.
Qwen Image 3.0 Pro est le modèle d’image d’Alibaba, construit autour du texte, et plus précisément du texte non anglophone.
Demandez à la plupart des modèles une enseigne chinoise, une étiquette japonaise ou un emballage coréen : vous obtenez une décoration en forme de caractères, convaincante au premier regard mais dénuée de sens pour qui sait les lire. Qwen Image 3.0 rend nativement douze langues et plus de vingt polices, avec une lisibilité jusqu’à dix pixels : les compositions riches en informations deviennent ainsi exploitables, pas seulement décoratives.
Utilisez Qwen Image 3.0 Pro lorsque le texte compte. Créez des emballages bilingues, de la signalétique régionale, des campagnes localisées, des pages de style journal, des maquettes d’interface et des infographies dont les légendes doivent résister à la lecture.

Qwen Image 3.0 Pro est un modèle de génération d’images par IA développé par Alibaba et publié en juillet 2026. Il génère des styles photographiques et illustratifs à partir de descriptions écrites et se distingue par son traitement de la typographie.
Le modèle repose sur trois atouts majeurs :
Alibaba mentionne aussi la simulation réaliste de pages web, jeux et habillages de diffusion en direct, ainsi que des détails allant jusqu’aux cheveux individuels. La fenêtre de 4 500 tokens représente environ quatre fois et demie celle de son prédécesseur, permettant de respecter des spécifications de mise en page en plusieurs parties dans une seule passe.

Du texte rendu comme du langage plutôt que comme une décoration en forme de caractères.
Une diversité typographique suffisante pour les mises en page nécessitant plusieurs voix.
Les compositions denses restent lisibles au lieu de devenir des textures.
Environ 4,5 fois celle du prédécesseur, adaptée aux instructions de mise en page en plusieurs parties.
Pages web, jeux et habillages de diffusion en direct reproduits de façon convaincante.
1K et 2K, au choix pour chaque génération.
Les caractères chinois, japonais et coréens sont rendus comme du langage. La plupart des modèles traitent les écritures CJK comme secondaires et produisent des formes crédibles seulement pour qui ne sait pas les lire.
Les compositions réunissant deux systèmes d’écriture sont souvent celles où les modèles échouent le plus, car leurs rythmes, graisses et espacements diffèrent. Celui-ci gère les deux dans la même image.
Le seuil de lisibilité des petits caractères distingue une composition décorative d’une mise en page exploitable. À dix pixels, pages de journal, infographies denses et maquettes d’interface deviennent réalisables plutôt qu’approximatives.
Environ 4 500 tokens permettent de préciser chaque bloc de texte, sa position et sa taille relative sans raccourcir l’instruction pour la faire tenir.
Pages web, interfaces d’application, écrans de jeux et habillages de diffusion sont explicitement pris en charge, ce qui est inhabituel et directement utile aux visuels marketing de produits.
Au-delà du texte, le modèle restitue les textures fines jusqu’aux cheveux individuels : une composition intégrant une photo n’a pas à sacrifier cet aspect.
La localisation multiplie le travail. Un visuel clé devient six versions de marché, chacune avec son texte et nécessitant un lecteur capable de le vérifier. Virse garde la famille réunie. La composition de base et toutes les variantes linguistiques sont côte à côte sur un même canevas : c’est le seul moyen pratique de repérer un mauvais saut de ligne dans la quatrième version.
Voyez toutes les versions localisées à la fois au lieu d’ouvrir six fichiers pour les comparer.
Placez le texte validé près du résultat pour relire par rapport à la source plutôt que de mémoire.
Passez de Qwen Image 3.0 Pro à plus de 30 autres modèles d’image et de vidéo sans quitter le canevas ni réécrire le descriptif.
Réutilisez le même descriptif de composition et ne changez que le texte pour préserver la cohérence visuelle entre les langues.
Façades d’emballage portant un nom de produit en caractères latins et CJK.
Scènes de rue et devantures dont les enseignes sont correctes pour un lecteur local.
Un même visuel clé adapté au texte de chaque marché sans être redessiné.
Écrans d’application, pages web et habillages aux textes lisibles.
Pages de style journal et infographies aux petites légendes lisibles.
Images associant de fins détails photographiques à un titre intégré.
Saisissez l’écriture à rendre. Transcriptions et descriptions ne la produiront pas.
Nommez chaque texte, sa position et sa taille par rapport aux autres.
Ébauchez à la petite taille, puis relancez en 2K après validation du texte.
Lisible et correct sont deux choses différentes. Faites lire le résultat par un locuteur natif.
Un prompt Qwen Image 3.0 Pro utile comprend généralement quatre éléments :
Au lieu d’écrire
Une devanture de restaurant de ramen japonais la nuit, avec une enseigne, atmosphérique.
Écrivez
Une étroite devanture de restaurant de ramen la nuit. Un rideau noren horizontal devant l’entrée porte 一番ラーメン en blanc sur indigo profond. À gauche, une enseigne verticale en bois porte 営業中 en caractères noirs au pinceau. Une lumière chaude s’échappe de l’intérieur et se reflète sur le trottoir mouillé. Photographique, vue de face depuis l’autre côté de la rue.
Une boîte de thé photographiée à plat sur fond pâle. La face avant porte 明前龍井 en grands caractères au pinceau, centrés dans la moitié supérieure, puis « Pre-Qingming Longjing » dans une petite police latine à empattements d’environ un tiers de la taille. Boîte vert jade assourdi, un filet doré fin entre les deux lignes, aucun autre graphisme. Lumière douce et homogène, cadrage carré.
Un écran d’application mobile vu de face remplissant le cadre. L’en-tête porte 我的订单 en graisse moyenne. Dessous, trois lignes de liste avec un nom de produit à gauche et un prix à droite en chiffres tabulaires. Barre de navigation inférieure avec quatre libellés : 首页, 分类, 购物车, 我的. Interface à plat, un seul accent bleu, fond blanc, tous les caractères nets et lisibles.
Une affiche événementielle minimale au format vertical. Le titre 静水 utilise une police moderne sans empattement de forte graisse, centrée dans le tiers supérieur. Dessous, beaucoup plus petit : « Slow Water · Photographs by Ana Reyes ». Fond sable uni, un filet horizontal fin sous le titre, aucune image. Larges marges sur les quatre côtés.
| Critère | Qwen Image 3.0 Pro | Ideogram 4.0 |
|---|---|---|
| Atout typographique | Écritures non latines et compositions bilingues | Typographie latine et structure de mise en page |
| Contrôle du placement | Décrit dans le descriptif | Cadres englobants et descriptifs JSON |
| Petits caractères | Lisible jusqu’à 10 pixels | Lisible en 2K native |
| Fenêtre de descriptif | Environ 4 500 tokens | Champs de prompt structurés |
| Également performant en | Détails photographiques, maquettes d’interface | Logos, affiches, contrôle des couleurs de marque |
| À choisir lorsque | Le texte n’utilise pas l’alphabet latin | Le livrable est une mise en page en écriture latine |
« Une enseigne portant 営業中 » fonctionne. « Une enseigne disant ouvert en japonais » ne fonctionne pas.
Enseignes, noms de produits et titres sont le domaine fiable. Les paragraphes dépassent ce qu’un modèle d’image actuel peut maintenir.
« Au tiers de la taille du titre » est exploitable, contrairement à « plus petit ». Cela compte encore davantage dans une composition bilingue où deux écritures se concurrencent.
Lisibilité et exactitude sont deux problèmes différents. Un lecteur repère ceux qui vous semblent corrects.
Collez l’écriture voulue, gardez des textes courts et faites vérifier le résultat par quelqu’un qui la lit avant livraison.