Ngày 16 tháng 4, nhóm Qwen của Alibaba đã phát hành mã nguồn mở Qwen3.6-35B-A3B theo giấy phép Apache 2.0, không có bất kỳ hạn chế thương mại nào.
Mô hình này có điểm đặc biệt: tổng tham số 35B, nhưng khi suy luận chỉ kích hoạt 3B. Sử dụng kiến trúc hỗn hợp chuyên gia (MoE) với tỷ lệ thưa tính toán 12:1 – hiệu quả gần bằng mô hình lớn 35B, chi phí vận hành tính theo 3B.
Trên SWE-bench Verified (bài kiểm tra sửa lỗi GitHub thực tế), mô hình đạt 73,4%, trong khi Gemma 4-31B do Google phát hành mã nguồn mở cùng kỳ chỉ đạt 52,0%, chênh lệch 21 điểm phần trăm.
Tại sao kiến trúc lại quan trọng
Trước hết, hãy nói về logic thiết kế của MoE.
Mô hình dày đặc thông thường, mỗi khi xử lý một token, tất cả các tham số đều tham gia tính toán. Mô hình 35B tham số, mỗi token đều cần đến 35B tính toán.
MoE khác biệt. Nó chia tham số thành nhiều "chuyên gia" (expert), mỗi lần chỉ kích hoạt một phần. Cơ chế định tuyến của Qwen3.6-35B-A3B mỗi lần chỉ gọi nhóm chuyên gia tương ứng với 3B tham số để xử lý mỗi token, nhưng toàn bộ mô hình tích lũy dung lượng kiến thức đại diện cho 35B tham số.
Kết quả là: tốc độ suy luận và mức sử dụng bộ nhớ tính theo 3B, khả năng giải quyết vấn đề tính theo 35B.
Trên RTX 4090, tốc độ chạy vượt quá 120 token/giây. MacBook Pro M4/M5 với 64GB RAM có thể chạy trực tiếp. Sau khi lượng tử hóa Q4_K_M, dung lượng khoảng 21GB, một card đồ họa tiêu dùng phổ thông có thể chứa được.
Điều này có ý nghĩa lớn đối với triển khai cục bộ – trước đây, để chạy mô hình lập trình tiên tiến mã nguồn mở, ít nhất cần có A100 hoặc nhiều card RTX 4090, giờ đây chỉ cần một card đồ họa tiêu dùng là đủ.
So sánh số liệu với các mô hình khác
So với Google Gemma 4-31B:
| Bài kiểm tra | Qwen3.6-35B | Gemma 4-31B |
|---|---|---|
| SWE-bench Verified | 73,4% | 52,0% |
| Terminal-Bench 2.0 | 51,5% | 42,9% |
| MCPMark (gọi công cụ) | 37,0% | 18,1% |
| GPQA (suy luận tổng quát) | 86,0% | 84,3% |
| AIME26 (toán thi đấu) | 92,7% | 89,2% |
Về gọi công cụ (MCPMark), Qwen3.6 cao gấp đôi Gemma 4. Kịch bản kiểm tra này tương ứng trực tiếp với hiệu suất trong các tác vụ Agent thực tế, thậm chí còn gần với sử dụng thực tế hơn SWE-bench.
QwenWebBench (tác vụ web) đạt 1397 ELO, cải thiện 43% so với thế hệ trước.
So với Claude Sonnet 4.5:
Theo đánh giá của The Decoder, trên benchmark lập trình thuần túy, hai mô hình gần như ngang nhau, chênh lệch nằm trong sai số đo lường. Về hội thoại kiểu trợ lý và trò chuyện thông thường, Claude vẫn dẫn đầu.
Chi tiết mã nguồn mở và khả năng sử dụng
Trọng số mô hình có thể tải xuống trên Hugging Face (Qwen/Qwen3.6-35B-A3B) và ModelScope, tương thích với Transformers, vLLM (>=0.19.0), SGLang (>=0.5.10) và KTransformers.
Hỗ trợ hai chế độ:
- Chế độ Thinking: giống mô hình suy luận, suy nghĩ sâu đa bước, giữ lại quy trình suy luận để kế thừa trong các cuộc hội thoại tiếp theo
- Chế độ Fast: đầu ra trực tiếp, phù hợp cho hội thoại và tác vụ nhẹ
Cửa sổ ngữ cảnh gốc 262.144 token, sau khi mở rộng YaRN có thể lên tới hơn 1 triệu token.
API cũng có thể được gọi thông qua Alibaba Cloud Model Studio (tên "Qwen3.6 Flash") hoặc tự triển khai.
Đánh giá
Đây là bước thứ ba của Alibaba theo hướng mã nguồn mở. Đầu tiên là phát hành mã nguồn mở Qwen3 cơ bản (giấy phép Apache), sau đó phát hành phiên bản doanh nghiệp đóng Qwen3.6-Plus, và sau đó phát hành mã nguồn mở Qwen3.6-35B-A3B, phiên bản chuyên biệt hóa lập trình hiệu suất cao.
Mỗi bước đều rất rõ ràng: trước tiên xây dựng cộng đồng và nền tảng nhà phát triển, sau đó kiếm tiền từ phiên bản đóng, rồi dùng phiên bản mã nguồn mở để đào sâu hệ sinh thái.
Kết quả 73,4% SWE-bench của Qwen3.6-35B-A3B nằm ở mức nào trong toàn bộ các mô hình mã nguồn mở? Hiện tại, trong số các mô hình mã nguồn mở, chỉ có DeepSeek V4 và mô hình này là đáng chú ý, còn trong số các mô hình đóng, Claude Sonnet 4.5 cũng chỉ ở quanh mức này. Một mô hình MoE có thể chạy cục bộ đạt được điểm số này, thực sự đã thay đổi điều gì đó.
Tất nhiên, điểm SWE-bench cao không đồng nghĩa với việc sử dụng trong sản xuất sẽ tốt. Hiệu suất thực tế của Agent lập trình còn phụ thuộc vào quản lý ngữ cảnh, phục hồi lỗi, độ ổn định của quy trình dài – những điều này đều không nằm trong benchmark. Nhưng điểm xuất phát đã được đặt ở đây, đáng để chạy thử nghiệm nghiêm túc.
Nguồn tham khảo: CocoLoop, Alibaba's open model Qwen3.6 leads Google's Gemma 4 across agentic coding benchmarks (The Decoder); Qwen3.6-35B-A3B: 73.4% SWE-Bench, Runs Locally (Build Fast with AI); Qwen3.6-35B-A3B Complete Review: Alibaba's Open-Source Coding Model (DEV Community)