Qwen-Image-2.1 passe en open source, l'usage commercial exige une licence à part

Le 20 septembre, l'équipe Qwen d'Alibaba a publié en open source le modèle d'image Qwen-Image-2.1, qui réunit génération d'image à partir de texte et retouche d'image dans un seul checkpoint. Les poids sont déjà sur Hugging Face, avec une intégration dès le premier jour dans diffusers et ComfyUI, ainsi qu'une démo dans le navigateur ne nécessitant aucune installation.

La principale différence avec les versions précédentes se situe au niveau de la licence. Le README indique le Qwen Research License Agreement, qui n'autorise que la recherche et l'évaluation ; pour un usage dans un produit commercial, il faut demander séparément une licence commerciale à l'équipe Qwen.

7 milliards de paramètres pour générer et retoucher

Selon le README officiel, la partie génération visuelle compte 7 milliards de paramètres, avec une architecture DiT à flux unique de 32 couches ; l'encodeur de texte utilisé est Qwen3-VL 8B, et les instructions textuelles comme les images de référence sont encodées dans une même représentation. L'autoencodeur fonctionne avec 64 canaux RGBA et une compression spatiale de 16 fois, ce qui permet de générer et de retoucher nativement des images à fond transparent, sans devoir d'abord produire un fond blanc puis le détourer.

La résolution native prise en charge est de 2K, avec sept ratios recommandés : le 1:1 correspond à 2048×2048, le 16:9 à 2752×1536, et le format vertical 9:16 à 1536×2752. Côté retouche, jusqu'à 10 images de référence peuvent être utilisées par session, avec des modifications locales via un cerclage, une annotation griffonnée ou un masque téléversé séparément ; l'apparence des personnages et des produits reste relativement cohérente sur plusieurs rondes de retouche. Les tâches de démonstration officielles incluent également des panoramas, des infographies, des storyboards, ainsi que l'extraction directe d'un sujet à partir d'une photo.

Le gain de vitesse repose sur deux choix de conception. D'abord une attention à granularité mixte : le texte utilise un masque causal par token, l'image un masque bidirectionnel par bloc. Ensuite, la réutilisation d'un cache KV à préfixe : l'image d'entrée et les instructions ne sont calculées qu'une seule fois, à la première étape de débruitage, et les dizaines d'étapes suivantes réutilisent directement ce cache. L'entreprise recommande officiellement 40 étapes d'inférence, sans donner de chiffres précis sur le temps de génération ou la VRAM minimale requise, indiquant seulement que les cartes manquant de VRAM peuvent activer le déchargement CPU (CPU offload).

Résultats au classement et positionnement

Selon les données de Qwen-Image-Bench compilées par un tiers, Qwen-Image-2.1 obtient un score total de 60,28, légèrement supérieur aux 59,82 de Nano Banana 2.0 et aux 59,65 de GPT Image 1.5 ; la génération précédente, Qwen-Image 1.0, n'atteignait que 49,23. Dans le classement général de 29 modèles, il occupe la septième place, les six premières étant toutes occupées par des modèles à code fermé ; en tête figure GPT Image 2.5 Sunburst, avec 67,01 points. Il s'agit d'un jeu d'évaluation propre à Alibaba, et aucune reproduction indépendante externe n'a encore été publiée.

La liste des frameworks d'inférence pris en charge dès le premier jour est fournie : vLLM-Omni, SGLang et LightX2V ont tous annoncé un support Day-0. La fiche du modèle laisse voir qu'Alibaba souhaite que ce modèle s'intègre au plus vite dans les flux de travail des développeurs.

D'Apache 2.0 à la licence de recherche

En reconstituant l'historique des licences de la lignée Qwen-Image, le changement est net. Qwen-Image 1.0 et Qwen-Image-Edit, sortis en août 2025, ainsi que Qwen-Image-Layered et Qwen-Image-2512, sortis en décembre, utilisaient tous la licence Apache 2.0, autorisant un usage commercial sans démarche préalable. Avec la 2.1, la licence passe à une licence de recherche ; le texte original précise que sans licence commerciale obtenue séparément, le matériel ne peut être utilisé à aucune fin commerciale.

Pour les petites et moyennes équipes qui font de la retouche photo e-commerce ou de la génération d'affiches, c'est un obstacle bien réel. La version précédente pouvait être déployée directement dans un produit payant ; celle-ci ne peut, avant d'obtenir la licence, servir qu'à des tests internes. La licence ne fixe aucun seuil d'exemption lié au chiffre d'affaires ou au nombre d'utilisateurs, ni de tarif public, et Alibaba n'a pour l'instant fait aucune annonce publique sur la façon dont la facturation sera organisée.

Du côté des grands modèles de langage de Qwen, un mouvement similaire avait déjà eu lieu — le site avait précédemment rapporté le passage de Qwen3.6-Max au code fermé. Cette fois, le modèle d'image conserve des poids ouverts, ne refermant qu'à moitié la porte de l'usage commercial. Reste à savoir si les flux de travail communautaires, les LoRA et les plugins bâtis sur la version Apache pourront être transposés à un usage commercial sur la 2.1 — une question qui ne trouvera de réponse que lorsqu'Alibaba aura complété les termes de la licence.

Sources : blog officiel de Qwen, README GitHub et fiche modèle Hugging Face de Qwen-Image-2.1 (paramètres, résolution, licence), blog officiel de ComfyUI, CocoLoop, comparatif de licences de CellCog (historique des licences des versions Qwen-Image et scores Qwen-Image-Bench).