阿里巴巴通義千問(Qwen)團隊9月20日開源影像模型「Qwen-Image-2.1」,把文字生成圖片與圖片編輯整合進同一個檢查點。權重已上架Hugging Face,第一天就支援diffusers與ComfyUI,另外還有一個免安裝的瀏覽器線上demo。
這一版和前幾代最大的差別在授權條款。README標註的是「Qwen Research License Agreement」,只允許研究與評估用途;要拿去做商業產品,得另外向Qwen團隊申請商業授權。
70億參數同時裝下生成與編輯
根據官方README,視覺生成部分是70億參數、32層單流DiT架構;文字編碼器用的是Qwen3-VL 8B,文字指令和參考圖會被編碼進同一套表示空間。自編碼器是64通道RGBA,空間壓縮16倍,所以透明背景的圖片可以原生生成與編輯,不必先產生白底再去背。
解析度原生支援2K,推薦7種比例:1:1是2048×2048,16:9是2752×1536,直式9:16是1536×2752。編輯功能單次最多可吃10張參考圖,局部修改可以用畫圈、塗鴉標註,或者單獨上傳遮罩;人物與商品的外觀在多輪編輯中盡量維持一致。官方展示的任務還包括全景圖、資訊圖表與分鏡腳本,以及直接從照片裡去背主體。
提速靠兩個設計。一是混合粒度注意力機制:文字採token層級的因果遮罩,圖片採區塊層級的雙向遮罩。二是前綴KV快取重複使用,輸入圖片和指令只在第一步去噪時計算一次,之後幾十步直接沿用快取。官方建議推論步數40步,沒有公布具體出圖耗時與顯存下限,只說顯存不夠的顯卡可以開啟CPU卸載。
榜單成績與定位
第三方整理的Qwen-Image-Bench資料顯示,Qwen-Image-2.1總分60.28,略高於Nano Banana 2.0的59.82與GPT Image 1.5的59.65;上一代Qwen-Image 1.0則是49.23分。在29個模型的總榜中排名第七,前六名全是閉源模型,榜首GPT Image 2.5 Sunburst拿下67.01分。這是阿里巴巴自家的評測集,外部複現結果目前還沒出現。
第一天適配的推論框架列得相當完整:vLLM-Omni、SGLang、LightX2V都標註了Day-0支援。從模型卡可以看出,阿里巴巴希望這款模型盡快進到開發者的工作流程裡。
從Apache 2.0走到研究授權
把Qwen-Image這條產品線的授權串起來看,變化相當清楚。2025年8月的Qwen-Image 1.0與Qwen-Image-Edit、12月的Qwen-Image-Layered與Qwen-Image-2512,用的都是Apache 2.0,商用不必另外打招呼。到了2.1,授權換成研究授權,原文寫的是在取得單獨商業授權之前,不得將素材用於任何商業目的。
對做電商修圖、海報生成的中小團隊來說,這是實實在在的門檻。上一代可以直接部署進付費產品,這一代在拿到授權之前只能拿來做內部測試。授權條款裡沒有寫營收或使用者規模的豁免線,也沒有公布授權價格,阿里巴巴目前沒有就收費方式做出公開說明。
通義千問的大型語言模型那邊已經有過類似動作,本站先前報導過Qwen3.6-Max轉為閉源。影像模型這次雖然保留了開放權重,卻把商用這道門關上了一半。原本靠Apache版本搭起來的社群工作流程、LoRA與外掛,能不能平移到2.1上商用,得等阿里巴巴把授權條款補齊才會知道。
參考來源:Qwen官方部落格、Qwen-Image-2.1 GitHub README與Hugging Face模型卡(參數、解析度、授權條款)、ComfyUI官方部落格、CocoLoop、CellCog授權比較整理(歷代Qwen-Image授權演變與Qwen-Image-Bench分數)。