Mô hình 27B của Alibaba đạt điểm ngang ngửa mô hình 397B của chính hãng

Ngày 22 tháng 4, nhóm Qwen đã phát hành một mô hình mới trên Hugging Face. Với 27 tỷ tham số, kiến trúc Dense, giấy phép Apache 2.0, mô hình có tên gọi Qwen3.6-27B.

Trong bài đăng công bố, họ đã liệt kê điểm benchmark. SWE-bench Verified: 77,2 điểm. Bên cạnh đó, họ cũng đưa ra điểm của Qwen3.5-397B-A17B: 76,2 điểm.

Một mô hình Dense 27B, trong bài kiểm tra lập trình, đã thắng mô hình MoE 397B hàng đầu của chính hãng.

Điều này không phải ngẫu nhiên, mà có những lý do cụ thể đằng sau.

MoE bắt đầu rò rỉ từ đâu

Kiến trúc MoE (Hỗn hợp chuyên gia) là giải pháp chính cho việc mở rộng mô hình lớn trong hai năm qua. Logic rất đơn giản: tổng số tham số lớn, nhưng mỗi lần suy luận chỉ kích hoạt một phần nhỏ "chuyên gia", do đó lượng tính toán thực tế tương đối kiểm soát được.

Qwen3.5-397B có tổng cộng 397 tỷ tham số, mỗi lần suy luận kích hoạt 17 tỷ. Qwen3.6-27B kích hoạt toàn bộ 27 tỷ tham số mỗi lần suy luận — xét về lượng tính toán thì tương đương, nhưng cách thức hoàn toàn khác nhau.

Suy luận của kiến trúc Dense nhất quán và dễ dự đoán hơn. MoE có một mức độ ngẫu nhiên nhất định trong quá trình định tuyến: các đầu vào khác nhau có thể kích hoạt các tổ hợp chuyên gia khác nhau, điều này có thể tích lũy sai lệch trong các tác vụ chuỗi dài.

Trong các tác vụ như sinh mã, tính ổn định là rất quan trọng. Bạn muốn "đúng từng bước", chứ không phải "trung bình thì tốt nhưng đôi khi bị lệch".

Trên Terminal-Bench 2.0, mô hình 27B đạt 59,3 điểm, trong khi mô hình 397B chỉ đạt 52,5. Trên SkillsBench, khoảng cách còn lớn hơn: 48,2 so với 30,0.

Mô hình Quy mô tham số SWE-bench Terminal-Bench SkillsBench
Qwen3.6-27B 27B Dense 77,2 59,3 48,2
Qwen3.5-397B-A17B 397B MoE 76,2 52,5 30,0

Trong cả ba bài kiểm tra, mô hình 27B đều thắng.

Thinking Preservation là gì

Qwen3.6-27B bổ sung một cơ chế gọi là "Thinking Preservation", đáng được đề cập riêng.

Trong các cuộc hội thoại nhiều lượt, mô hình sẽ giữ lại bản tóm tắt quá trình suy luận trước đó, và ở lượt tiếp theo không cần suy luận lại từ đầu — mà tiếp tục dựa trên kết quả suy nghĩ của lượt trước.

Điều này rất hữu ích trong quy trình làm việc của Agent. Một Agent cần hoàn thành nhiệm vụ mười bước, kết quả phân tích của ba bước đầu tiên không nên biến mất ở bước thứ tư, mà nên được tiếp tục như ngữ cảnh. Điều này giảm việc sinh token lặp lại và cũng giảm "sự trôi dạt quên lãng" trong các tác vụ dài.

Thiết kế này ngược hướng với cơ chế định tuyến của MoE: MoE mở rộng tham số theo chiều ngang, Thinking Preservation tối ưu hóa việc truyền trạng thái theo chiều dọc. Hai hướng tiếp cận giải quyết các vấn đề ở các cấp độ khác nhau.

Có thể chạy trên phần cứng tiêu dùng

Đây là một giá trị thực tế khác của mô hình này.

Phiên bản đầy đủ của Qwen3.5-397B cần 807GB dung lượng lưu trữ. Phiên bản lượng tử hóa cũng cần vài trăm GB, để chạy được cần một máy chủ nhiều GPU, hầu hết các nhà phát triển thông thường không có khả năng.

Qwen3.6-27B:

  • Phiên bản đầy đủ: 55,6GB
  • Phiên bản GGUF lượng tử hóa: 16,8GB
  • Có thể chạy trên một card RTX 4090, tốc độ khoảng 25 token/giây
  • MacBook M4 Max thậm chí còn không vấn đề

Cửa sổ ngữ cảnh mặc định là 262.144 token, có thể mở rộng lên 1 triệu. Giấy phép Apache 2.0, không hạn chế sử dụng thương mại.

Điều này đã hạ thấp đáng kể rào cản triển khai cục bộ. Các nhóm kỹ sư muốn triển khai một Agent lập trình trong mạng nội bộ, không muốn gửi mã lên API đám mây — trước đây con đường này hoặc là dùng mô hình mã nguồn mở kém, hoặc là mua máy chủ GPU đắt tiền. Bây giờ đã có một lựa chọn.

Điều này có ý nghĩa gì đối với MoE

Thời điểm phát hành của Alibaba lần này rất thú vị. Qwen3.6-27B ra mắt vài ngày sau Qwen3.6-Max (phiên bản đóng hàng đầu) — một mô hình thể hiện khả năng đỉnh cao để thu hút khách hàng thương mại, một mô hình dành cho cộng đồng nhà phát triển. Hai chân, phục vụ các nhóm đối tượng khác nhau.

Nhưng câu hỏi lớn hơn là: Nếu một mô hình Dense 27B trong mã hóa tác nhân đã có thể sánh ngang với Claude Opus 4.5, thì cuộc cạnh tranh tiếp theo sẽ diễn ra ở chiều kích nào?

Trên Terminal-Bench, mô hình 27B và Claude Opus 4.5 ngang điểm nhau, trong khi giá API của Opus 4.5 là trên 15 đô la Mỹ cho mỗi triệu token. Qwen3.6-27B là mã nguồn mở và có thể tự triển khai.

Lợi ích gia tăng từ benchmark ngày càng nhỏ. Người dùng bắt đầu quan tâm nhiều hơn đến độ trễ, chi phí và khả năng triển khai cục bộ.

Xu hướng này có lợi cho các mô hình mã nguồn mở và gây áp lực lên các dịch vụ API đóng.

Bước tiếp theo, xem Kimi, DeepSeek và MiniMax sẽ phản ứng thế nào.

Nguồn tham khảo: CocoLoop, Qwen3.6-27B: Flagship-Level Coding in a 27B Dense Model (Simon Willison's Blog); Alibaba's Qwen3.6-27B Beats 397B Model in Coding Tasks (AI Daily Post); Qwen3.6-27B (Hacker News)