阿里通义千问团队 9 月 20 日开源图像模型 Qwen-Image-2.1,把文生图和图像编辑合进同一个检查点。权重已放上 Hugging Face,首日接入 diffusers 和 ComfyUI,另有一个免安装的浏览器在线 demo。
这一版和前几代最大的不同落在许可证上。README 标注的是 Qwen Research License Agreement,只允许研究和评估用途;要拿去做商业产品,需要另外向 Qwen 团队申请商业许可。
7B 装下生成和编辑
按官方 README,视觉生成部分是 7B 参数、32 层单流 DiT;文本编码器用的是 Qwen3-VL 8B,文字指令和参考图被编码进同一套表示里。自编码器是 64 通道 RGBA,空间压缩 16 倍,所以透明背景的图可以原生生成和编辑,不用先出白底再抠。
分辨率原生支持 2K,推荐 7 种比例,1:1 是 2048×2048,16:9 是 2752×1536,竖版 9:16 是 1536×2752。编辑侧单次最多吃 10 张参考图,局部修改可以画圈、涂鸦标注或者单独传蒙版,人物和商品的外观在多轮编辑里尽量保持一致。官方演示的任务还包括全景图、信息图和分镜,以及从照片里直接抠出主体。
提速靠两处设计。一是混合粒度的注意力:文本按 token 做因果掩码,图像按块做双向掩码。二是前缀 KV cache 复用,输入图和指令只在第一步去噪时算一次,后面几十步直接复用缓存。官方推荐 40 步推理,没有给出具体的出图耗时和显存下限,只说显存不够的卡可以开 CPU offload。
榜单成绩和位置
第三方整理的 Qwen-Image-Bench 数据显示,Qwen-Image-2.1 总分 60.28,略高于 Nano Banana 2.0 的 59.82 和 GPT Image 1.5 的 59.65;上一代 Qwen-Image 1.0 是 49.23。放进 29 个模型的总榜里它排第七,前六名全是闭源模型,榜首 GPT Image 2.5 Sunburst 67.01 分。这是阿里自己的评测集,外部复现还没出来。
首日适配的推理框架列得很全:vLLM-Omni、SGLang、LightX2V 都写了 Day-0 支持。模型卡上看得出,阿里希望它尽快进到开发者的工作流里。
从 Apache 2.0 到研究许可
把 Qwen-Image 这条线的授权串起来看,变化很清楚。2025 年 8 月的 Qwen-Image 1.0 和 Qwen-Image-Edit、12 月的 Qwen-Image-Layered 和 Qwen-Image-2512,用的都是 Apache 2.0,商用不用打招呼。到 2.1,协议换成了研究许可,原文写的是未取得单独商业许可前,不得将材料用于任何商业目的。
对做电商修图、海报生成的中小团队,这是实打实的门槛。上一代可以直接部署进付费产品,这一代在拿到授权之前只能内部测试。许可证里没有写营收或用户规模的豁免线,也没有公开授权价格,阿里目前没有就收费方式作公开说明。
千问的大语言模型这边已经有过类似动作,站内此前报道过 Qwen3.6-Max 转为闭源。图像模型这次保留了开放权重,只是把商用这道门关上了一半。原先靠 Apache 版本搭起来的社区工作流、LoRA 和插件,能不能平移到 2.1 上商用,要等阿里把授权条款补全才知道。
参考来源:Qwen 官方博客、Qwen-Image-2.1 GitHub README 与 Hugging Face 模型卡(参数、分辨率、许可证)、ComfyUI 官方博客、CocoLoop、CellCog 许可证对比整理(历代 Qwen-Image 授权与 Qwen-Image-Bench 分数)。