Das Qwen-Team von Alibaba hat am 20. September das Bildmodell Qwen-Image-2.1 als Open Source veröffentlicht und Text-zu-Bild sowie Bildbearbeitung in einem einzigen Checkpoint zusammengeführt. Die Gewichte stehen auf Hugging Face bereit, am ersten Tag gab es bereits Integrationen für diffusers und ComfyUI sowie eine installationsfreie Browser-Demo.
Der größte Unterschied zu den Vorgängerversionen liegt in der Lizenz. Im README steht die Qwen Research License Agreement, die nur Forschung und Evaluierung erlaubt; für kommerzielle Produkte muss beim Qwen-Team separat eine kommerzielle Lizenz beantragt werden.
7B Parameter für Generierung und Bearbeitung zugleich
Laut offiziellem README hat der Bildgenerierungsteil 7B Parameter und ist ein 32-schichtiges Single-Stream-DiT; als Textencoder kommt Qwen3-VL 8B zum Einsatz, Textanweisungen und Referenzbilder werden in dieselbe Repräsentation codiert. Der Autoencoder arbeitet mit 64 RGBA-Kanälen und komprimiert räumlich um das 16-Fache, sodass Bilder mit transparentem Hintergrund nativ erzeugt und bearbeitet werden können, ohne zuerst einen weißen Hintergrund zu rendern und ihn dann freizustellen.
Die native Auflösung unterstützt 2K, empfohlen werden sieben Seitenverhältnisse: 1:1 entspricht 2048×2048, 16:9 entspricht 2752×1536, das Hochformat 9:16 entspricht 1536×2752. Bei der Bearbeitung können pro Durchgang bis zu 10 Referenzbilder verarbeitet werden, lokale Änderungen lassen sich per Kreis, Skizzenmarkierung oder separat hochgeladener Maske vornehmen; das Erscheinungsbild von Figuren und Produkten bleibt über mehrere Bearbeitungsrunden hinweg weitgehend konsistent. Zu den offiziellen Demo-Aufgaben gehören außerdem Panoramen, Infografiken, Storyboards sowie das direkte Freistellen von Motiven aus Fotos.
Die Geschwindigkeit beruht auf zwei Designentscheidungen. Erstens Attention mit gemischter Granularität: Text wird tokenweise mit einer kausalen Maske behandelt, Bilder blockweise mit einer bidirektionalen Maske. Zweitens die Wiederverwendung eines Präfix-KV-Cache: Eingabebild und Anweisung werden nur im ersten Entrauschungsschritt berechnet, die folgenden Dutzenden Schritte greifen direkt auf den Cache zurück. Offiziell werden 40 Inferenzschritte empfohlen, konkrete Angaben zu Generierungszeit oder minimalem VRAM-Bedarf gibt es nicht – nur der Hinweis, dass Karten mit zu wenig VRAM CPU-Offload aktivieren können.
Ranking-Ergebnisse und Positionierung
Laut von Dritten zusammengestellten Qwen-Image-Bench-Daten erreicht Qwen-Image-2.1 einen Gesamtscore von 60,28 – etwas höher als Nano Banana 2.0 mit 59,82 und GPT Image 1.5 mit 59,65; die Vorgängerversion Qwen-Image 1.0 kam auf 49,23. In der Gesamtrangliste von 29 Modellen belegt es Platz sieben, die ersten sechs Plätze gehen ausnahmslos an Closed-Source-Modelle, Spitzenreiter ist GPT Image 2.5 Sunburst mit 67,01 Punkten. Es handelt sich um Alibabas eigenes Testset, eine externe Reproduktion liegt noch nicht vor.
Die Liste der am ersten Tag unterstützten Inferenz-Frameworks ist umfangreich: vLLM-Omni, SGLang und LightX2V haben allesamt Day-0-Support vermerkt. Aus der Modellkarte lässt sich ablesen, dass Alibaba das Modell möglichst schnell in die Workflows von Entwicklern bringen will.
Von Apache 2.0 zur Forschungslizenz
Betrachtet man die Lizenzhistorie der Qwen-Image-Reihe im Zusammenhang, wird der Wandel deutlich. Qwen-Image 1.0 und Qwen-Image-Edit von August 2025 sowie Qwen-Image-Layered und Qwen-Image-2512 von Dezember standen allesamt unter Apache 2.0, kommerzielle Nutzung war ohne Rückfrage möglich. Bei 2.1 wechselt die Lizenz zu einer Forschungslizenz; im Originaltext heißt es, dass das Material ohne separat erworbene kommerzielle Lizenz zu keinem kommerziellen Zweck verwendet werden darf.
Für kleine und mittlere Teams, die E-Commerce-Bildbearbeitung oder Postergenerierung betreiben, ist das eine echte Hürde. Die Vorgängerversion ließ sich direkt in kostenpflichtige Produkte integrieren, diese Version kann bis zur Lizenzierung nur intern getestet werden. Die Lizenz nennt weder eine Freigrenze nach Umsatz oder Nutzerzahl noch einen öffentlichen Preis – Alibaba hat sich bislang nicht öffentlich zur Abrechnung geäußert.
Auf Seiten der großen Sprachmodelle von Qwen gab es bereits einen ähnlichen Schritt – die Seite berichtete zuvor, dass Qwen3.6-Max auf Closed Source umgestellt wurde. Beim Bildmodell bleiben die Gewichte diesmal offen, nur die kommerzielle Tür wurde halb geschlossen. Ob die Community-Workflows, LoRAs und Plugins, die auf der Apache-Version aufgebaut wurden, sich kommerziell auf 2.1 übertragen lassen, zeigt sich erst, wenn Alibaba die Lizenzbedingungen vervollständigt hat.
Quellen: offizieller Qwen-Blog, GitHub-README und Hugging-Face-Modellkarte von Qwen-Image-2.1 (Parameter, Auflösung, Lizenz), offizieller ComfyUI-Blog, CocoLoop, Lizenzvergleich von CellCog (Lizenzhistorie der Qwen-Image-Reihe und Qwen-Image-Bench-Scores).