Ngày 20 tháng 9, nhóm Qwen (Thông Nghĩa Thiên Vấn) của Alibaba mở nguồn mô hình ảnh Qwen-Image-2.1, gộp chung tính năng sinh ảnh từ văn bản và chỉnh sửa ảnh vào cùng một checkpoint. Trọng số mô hình đã lên Hugging Face, ngày đầu tiên đã tích hợp với diffusers và ComfyUI, ngoài ra còn có bản demo chạy trên trình duyệt, không cần cài đặt.
Điểm khác biệt lớn nhất so với các phiên bản trước nằm ở giấy phép. README ghi rõ đây là Qwen Research License Agreement, chỉ cho phép dùng cho nghiên cứu và đánh giá; muốn đưa vào sản phẩm thương mại, phải xin giấy phép thương mại riêng từ nhóm Qwen.
7B tham số gánh cả sinh ảnh lẫn chỉnh sửa
Theo README chính thức, phần sinh ảnh thị giác có 7B tham số, kiến trúc DiT đơn luồng 32 lớp; bộ mã hóa văn bản dùng Qwen3-VL 8B, chỉ dẫn văn bản và ảnh tham chiếu được mã hóa chung vào một biểu diễn. Bộ tự mã hóa (autoencoder) có 64 kênh RGBA, nén không gian 16 lần, nên ảnh nền trong suốt có thể sinh và chỉnh sửa trực tiếp mà không cần xuất nền trắng rồi tách nền.
Độ phân giải hỗ trợ gốc 2K, khuyến nghị 7 tỷ lệ khung hình, tỷ lệ 1:1 là 2048×2048, 16:9 là 2752×1536, khổ dọc 9:16 là 1536×2752. Ở phần chỉnh sửa, mỗi lượt nhận tối đa 10 ảnh tham chiếu, có thể chỉnh sửa cục bộ bằng cách khoanh vùng, vẽ nguệch ngoạc đánh dấu hoặc tải mask riêng; hình dáng nhân vật và sản phẩm được giữ ổn định tương đối qua nhiều lượt chỉnh sửa. Các tác vụ demo chính thức còn có ảnh toàn cảnh, infographic, storyboard, và tách chủ thể trực tiếp từ ảnh chụp.
Tốc độ được cải thiện nhờ hai thiết kế. Một là cơ chế attention đa mức độ hạt: văn bản dùng causal mask theo token, ảnh dùng bidirectional mask theo khối. Hai là tái sử dụng prefix KV cache: ảnh đầu vào và chỉ dẫn chỉ được tính một lần ở bước khử nhiễu đầu tiên, các bước sau (hàng chục bước) tái sử dụng cache trực tiếp. Hãng khuyến nghị suy luận 40 bước, không công bố thời gian sinh ảnh cụ thể hay yêu cầu VRAM tối thiểu, chỉ nói card thiếu VRAM có thể bật CPU offload.
Vị trí trên bảng xếp hạng
Theo dữ liệu Qwen-Image-Bench do bên thứ ba tổng hợp, Qwen-Image-2.1 đạt tổng điểm 60,28, nhỉnh hơn Nano Banana 2.0 (59,82) và GPT Image 1.5 (59,65); phiên bản trước là Qwen-Image 1.0 chỉ đạt 49,23. Trong bảng xếp hạng tổng 29 mô hình, nó đứng thứ 7, sáu vị trí đầu đều là mô hình đóng nguồn, dẫn đầu là GPT Image 2.5 Sunburst với 67,01 điểm. Đây là bộ đánh giá riêng của Alibaba, bên ngoài chưa có kết quả tái lập độc lập.
Danh sách framework suy luận hỗ trợ ngay ngày đầu khá đầy đủ: vLLM-Omni, SGLang, LightX2V đều đã công bố hỗ trợ Day-0. Nhìn vào model card có thể thấy Alibaba muốn mô hình này nhanh chóng đi vào quy trình làm việc của lập trình viên.
Từ Apache 2.0 sang giấy phép nghiên cứu
Nhìn lại chuỗi cấp phép của dòng Qwen-Image, sự thay đổi khá rõ ràng. Qwen-Image 1.0 và Qwen-Image-Edit hồi tháng 8/2025, cùng Qwen-Image-Layered và Qwen-Image-2512 hồi tháng 12, đều dùng giấy phép Apache 2.0, dùng thương mại không cần xin phép. Đến bản 2.1, giấy phép chuyển sang giấy phép nghiên cứu, nguyên văn ghi rằng nếu chưa có giấy phép thương mại riêng thì không được dùng tài liệu này cho bất kỳ mục đích thương mại nào.
Với các đội nhóm nhỏ và vừa làm chỉnh sửa ảnh thương mại điện tử, tạo poster, đây là rào cản thực sự. Phiên bản trước có thể triển khai thẳng vào sản phẩm trả phí, phiên bản này trước khi được cấp phép chỉ có thể dùng thử nghiệm nội bộ. Giấy phép không ghi ngưỡng miễn trừ theo doanh thu hay quy mô người dùng, cũng không công bố giá cấp phép, hiện Alibaba chưa có thông báo công khai về cách tính phí.
Bên mảng mô hình ngôn ngữ lớn của Qwen cũng từng có động thái tương tự — trang tin từng đưa tin Qwen3.6-Max chuyển sang đóng nguồn. Lần này mô hình ảnh vẫn giữ trọng số mở, chỉ khép lại một nửa cánh cửa thương mại hóa. Các quy trình làm việc cộng đồng, LoRA và plugin vốn dựng trên bản Apache trước đây có thể chuyển sang dùng thương mại trên bản 2.1 hay không, phải chờ Alibaba bổ sung đầy đủ điều khoản cấp phép mới rõ.
Nguồn tham khảo: blog chính thức của Qwen, README GitHub và model card Hugging Face của Qwen-Image-2.1 (tham số, độ phân giải, giấy phép), blog chính thức ComfyUI, CocoLoop, tổng hợp so sánh giấy phép của CellCog (lịch sử cấp phép các bản Qwen-Image và điểm Qwen-Image-Bench).