Trước hết là con số này: SWE-bench Pro 53,5 so với 50,9.
Con số đầu là của Qwen3.6-27B, mô hình 27B tham số, vừa được phát hành mã nguồn mở vào ngày 22 tháng 4 theo giấy phép Apache 2.0. Con số sau là của Qwen3.5-397B, mô hình 397B tham số với kiến trúc hỗn hợp chuyên gia (MoE), từng là mô hình chủ lực của Alibaba.
Một mô hình nhỏ với 27 tỷ tham số đánh bại một mô hình lớn với gần 40 tỷ tham số kích hoạt trong bài kiểm tra kỹ thuật phần mềm – điều này không phải chuyện nhỏ.
Thinking Preservation: Đây mới là điểm mấu chốt
Thành thật mà nói, câu chuyện "càng ít tham số càng mạnh" đã xuất hiện nhiều lần trong giới này rồi. Thành tích của Qwen3.6-27B không đến từ kiến trúc cốt lõi, mà đến từ một tính năng mới: Thinking Preservation (Giữ lại suy luận).
Có một vấn đề bị bỏ qua trong các LLM mã nguồn mở: khi Agent thực hiện các tác vụ đa lượt, quá trình suy luận của mỗi lượt thường bị loại bỏ. Mô hình phải suy luận lại từ đầu mỗi lần, thay vì tái sử dụng các chuỗi nhận thức đã được xây dựng trước đó.
Cách tiếp cận của Qwen3.6-27B là giữ lại "dấu vết suy luận" từ các tin nhắn lịch sử như một ngữ cảnh liên tục:
"giữ lại và tận dụng các dấu vết suy luận từ các tin nhắn lịch sử trong toàn bộ cuộc hội thoại thay vì loại bỏ suy luận trước đó, cải thiện hiệu quả trong các quy trình làm việc đa lượt của Agent"
Nói một cách dễ hiểu: mô hình nhớ được cách nó đã suy nghĩ trước đó, thay vì reset về 0 mỗi lần.
Trong các tác vụ mã hóa agentic, sự khác biệt này rất rõ ràng. Khi xử lý cùng một kho mã nguồn, mô hình nhớ được kết luận suy luận của lượt trước và mô hình không nhớ có sự chênh lệch lớn về hiệu suất. SWE-bench Pro vốn dĩ là bài kiểm tra chạy trên các kho mã thực tế, nên lợi thế này càng được khuếch đại.
Bảng điểm toàn diện
Không chỉ SWE-bench, Qwen3.6-27B thể hiện tốt trên nhiều mặt:
| Bài kiểm tra | Qwen3.6-27B | So sánh |
|---|---|---|
| SWE-bench Pro | 53,5 | so với Qwen3.5-397B MoE: 50,9 |
| Terminal-Bench 2.0 | 59,3 | ngang bằng với Claude Opus phiên bản cao cấp |
| AIME26 (Toán học) | 94,1 | so với Qwen3.5-27B: 92,6 |
| QwenWebBench | 1487 | so với Qwen3.5-27B: 1068 (+39%) |
| SkillsBench trung bình | 48,2 | cải thiện 77% so với mô hình cùng kích thước thế hệ trước |
| GPQA Diamond | 87,8 | so với Qwen3.5-27B: 85,5 |
Mức cải thiện 77% trên SkillsBench đáng được nhắc riêng. Bài kiểm tra này đo lường khả năng tổng quát đa lĩnh vực. Từ Qwen3.5-27B lên Qwen3.6-27B không phải là sửa chữa nhỏ lẻ, mà là một cuộc tái cấu trúc ở cấp độ hệ thống.
Cửa sổ ngữ cảnh
Hỗ trợ gốc 262.144 token (khoảng 200.000 ký tự tiếng Trung), có thể mở rộng lên 1.010.000 token bằng cách sử dụng YaRN.
Đối với các tình huống cần xử lý kho mã nguồn dài hoặc tài liệu dài, cửa sổ ngữ cảnh này là đủ.
Mã nguồn mở có ý nghĩa gì
Giấy phép Apache 2.0, không hạn chế sử dụng thương mại.
Đối với doanh nghiệp, điều này còn thực tế hơn các con số hiệu suất: mô hình 27B tham số có chi phí triển khai cục bộ thấp hơn nhiều so với 397B, nhưng lại đạt điểm cao hơn trong các tác vụ cốt lõi – sự kết hợp này rất hấp dẫn đối với các công ty muốn xây dựng năng lực AI nội bộ. Hãy nghĩ mà xem, một GPU tiêu dùng có thể chạy được 27B, trong khi 397B cần ít nhất nhiều GPU cao cấp.
Đây cũng là lý do con số 77% trên SkillsBench rất quan trọng: không chỉ mạnh hơn về mã, mà năng lực tổng quát được cải thiện toàn diện – đó mới là tiền đề thực sự để thay thế các mô hình lớn.
Cục diện tuần này
Tuần này thật trùng hợp, OpenAI phát hành GPT-5.5, Alibaba phát hành Qwen3.6-27B.
Nhìn chung hai sự kiện: mô hình đóng cao cấp theo đuổi "nhanh hơn, ít token hơn", trong khi mô hình mã nguồn mở nhỏ theo đuổi "dùng ít tham số hơn để đạt kết quả tốt hơn". Hướng đi khác nhau, nhưng cả hai đều đang thu hẹp khoảng cách với nhau.
Điều tiếp theo có thể bị thay đổi, không phải là một công ty nào đó, mà là giả định "cần mô hình lớn mới chạy được mã tốt".
Nguồn tham khảo: CocoLoop, Alibaba Qwen Team Releases Qwen3.6-27B: A Dense Open-Weight Model Outperforming 397B MoE on Agentic Coding Benchmarks (MarkTechPost)