Tim Qwen dari Alibaba merilis model gambar Qwen-Image-2.1 sebagai open source pada 20 September, menggabungkan pembuatan gambar dari teks dan penyuntingan gambar dalam satu checkpoint. Bobot model sudah tersedia di Hugging Face, dengan dukungan diffusers dan ComfyUI sejak hari pertama, plus demo berbasis browser yang tidak perlu instalasi.
Perbedaan terbesar dari generasi sebelumnya ada pada lisensinya. README mencantumkan Qwen Research License Agreement, yang hanya mengizinkan penggunaan untuk riset dan evaluasi; untuk dipakai dalam produk komersial, harus mengajukan lisensi komersial terpisah ke tim Qwen.
7B Parameter untuk Generasi dan Penyuntingan
Menurut README resmi, bagian generasi visual menggunakan 7B parameter dengan arsitektur single-stream DiT 32 lapis. Text encoder-nya adalah Qwen3-VL 8B, yang mengenkode instruksi teks dan gambar referensi ke dalam ruang representasi yang sama. Autoencoder-nya RGBA 64 kanal dengan kompresi spasial 16x, sehingga gambar dengan latar belakang transparan bisa dihasilkan dan disunting secara native, tanpa perlu membuat latar putih dulu lalu memotongnya.
Resolusi native mencapai 2K dengan tujuh rasio aspek yang direkomendasikan: 1:1 pada 2048×2048, 16:9 pada 2752×1536, dan potret 9:16 pada 1536×2752. Untuk penyuntingan, satu proses bisa menerima hingga 10 gambar referensi, dan perubahan lokal bisa ditandai dengan lingkaran, coretan, atau mask terpisah; tampilan orang dan produk diusahakan tetap konsisten di berbagai putaran penyuntingan. Demo resmi juga mencakup pembuatan panorama, infografis, storyboard, hingga memotong subjek langsung dari foto.
Ada dua desain yang mendorong kecepatannya. Pertama, attention dengan granularitas campuran: teks memakai causal mask di level token, gambar memakai bidirectional mask di level blok. Kedua, penggunaan ulang prefix KV cache — gambar input dan instruksi hanya dihitung sekali pada langkah denoising pertama, lalu cache-nya dipakai ulang untuk puluhan langkah berikutnya. Alibaba merekomendasikan 40 langkah inferensi, tanpa mengumumkan waktu generasi spesifik atau batas minimum VRAM, hanya menyebut kartu grafis dengan memori terbatas bisa mengaktifkan CPU offload.
Skor Benchmark dan Posisinya
Data Qwen-Image-Bench yang dihimpun pihak ketiga menunjukkan Qwen-Image-2.1 meraih skor total 60,28, sedikit di atas Nano Banana 2.0 yang 59,82 dan GPT Image 1.5 yang 59,65; generasi sebelumnya, Qwen-Image 1.0, hanya 49,23. Dari total 29 model di papan peringkat, model ini menempati posisi ketujuh — enam posisi teratas semuanya model closed source, dengan GPT Image 2.5 Sunburst di puncak dengan skor 67,01. Ini adalah benchmark milik Alibaba sendiri, dan reproduksi independen dari pihak luar belum muncul.
Dukungan framework inferensi sejak hari pertama cukup luas: vLLM-Omni, SGLang, dan LightX2V semuanya mencantumkan dukungan Day-0. Dari model card-nya terlihat Alibaba ingin model ini cepat masuk ke alur kerja para developer.
Dari Apache 2.0 ke Lisensi Riset
Kalau ditelusuri riwayat lisensi lini Qwen-Image, perubahannya terlihat jelas. Qwen-Image 1.0 dan Qwen-Image-Edit dari Agustus 2025, serta Qwen-Image-Layered dan Qwen-Image-2512 dari Desember, semuanya memakai Apache 2.0, yang bisa langsung dipakai komersial tanpa izin tambahan. Di versi 2.1, lisensinya berganti menjadi lisensi riset; teksnya menyatakan bahwa materi tidak boleh dipakai untuk tujuan komersial apa pun tanpa lisensi komersial terpisah.
Bagi tim kecil-menengah yang mengerjakan retouching foto e-commerce atau pembuatan poster, ini jadi hambatan nyata. Generasi sebelumnya bisa langsung dipakai di produk berbayar; generasi ini hanya boleh dipakai untuk pengujian internal sampai lisensinya didapat. Lisensi tersebut tidak mencantumkan ambang pendapatan atau jumlah pengguna sebagai pengecualian, dan harganya pun belum diumumkan. Alibaba sejauh ini belum memberikan penjelasan resmi soal skema biayanya.
Di sisi model bahasa besar Qwen, langkah serupa sudah pernah terjadi — situs ini sebelumnya melaporkan Qwen3.6-Max beralih menjadi closed source. Model gambar kali ini tetap merilis bobot terbuka, tapi menutup separuh pintu untuk penggunaan komersial. Apakah alur kerja komunitas, LoRA, dan plugin yang dibangun di atas versi Apache bisa dipindahkan ke penggunaan komersial di 2.1, masih harus menunggu Alibaba melengkapi ketentuan lisensinya.
Sumber: blog resmi Qwen, README GitHub Qwen-Image-2.1 dan model card Hugging Face (parameter, resolusi, lisensi), blog resmi ComfyUI, CocoLoop, rangkuman perbandingan lisensi oleh CellCog (riwayat lisensi Qwen-Image dan skor Qwen-Image-Bench).