GLM-5.1 dẫn đầu SWE-Bench Pro, huấn luyện hoàn toàn trên chip Huawei Ascend

Ngày 7 tháng 4, Z.ai (trước đây là Zhipu AI) đã phát hành GLM-5.1, với 754B tham số, kiến trúc MoE, mã nguồn mở theo giấy phép MIT.

Kết quả benchmark: SWE-Bench Pro đạt 58,4%, đứng đầu toàn cầu. GPT-5.4 đạt 57,7%, Claude Opus 4.6 đạt 57,3%.

Chỉ riêng con số này đã đủ tạo nên một làn sóng — một mô hình mã nguồn mở đã vượt qua hai mô hình đóng hàng đầu về khả năng lập trình. Nhưng điều thú vị hơn là một khía cạnh khác:

Mô hình này được huấn luyện hoàn toàn trên chip Huawei Ascend 910Bframework MindSpore, không có bất kỳ GPU NVIDIA nào tham gia.

Thông số kỹ thuật của mô hình

Trước hết, hãy xem các chỉ số cứng:

Tham số Giá trị
Tổng số tham số 754B
Số tham số kích hoạt mỗi lần 40B
Kiến trúc MoE + Dynamic Sparse Attention
Cửa sổ ngữ cảnh 200K tokens
Đầu ra tối đa 131072 tokens
Kích thước tệp mô hình 1,51TB (HuggingFace)
Giấy phép MIT

Kết quả một số benchmark:

  • SWE-Bench Pro: 58,4% (đứng đầu toàn cầu)
  • CyberGym: 68,7%
  • BrowseComp: 68,0%
  • AIME 2026: 95,3%

SWE-Bench Pro đo lường khả năng sửa lỗi GitHub thực tế, không phải tập dữ liệu tổng hợp dễ dàng đạt điểm cao. Con số 58,4% có giá trị thực chất.

Agent có thể chạy 8 giờ

GLM-5.1 có một khả năng ít được đề cập nhưng rất quan trọng: khả năng tự chủ thực thi.

Mô tả chính thức là "thực thi tác vụ độc lập trong hơn 8 giờ, trải qua hàng trăm vòng thao tác, hàng nghìn lần gọi công cụ" — có thể làm việc liên tục trong hơn 8 giờ, xử lý hàng trăm vòng tác vụ và hàng nghìn lần gọi công cụ.

Hầu hết các mô hình trong các tác vụ agent phức tạp không thể vượt quá vài chục vòng trước khi mất kiểm soát: cửa sổ ngữ cảnh bị đầy, suy luận bắt đầu trục trặc, gọi công cụ bắt đầu lặp lại. GLM-5.1 rõ ràng đã được tối ưu hóa đặc biệt cho vấn đề này, không chỉ dựa vào cửa sổ ngữ cảnh lớn.

Đây là một bước tiến thực chất cho việc triển khai Agent cấp doanh nghiệp, không chỉ là điểm số benchmark.

Điểm đáng chú ý nhất: Không có NVIDIA

Phần cứng huấn luyện: Huawei Ascend 910B
Framework huấn luyện: Huawei MindSpore

Đây không phải là một chi tiết nhỏ.

Trong một thời gian dài, con đường tối ưu để huấn luyện các mô hình quy mô lớn hầu như chỉ có một: CUDA của NVIDIA. H100, H800, A100 — dùng được cái nào dùng cái đó, và MindSpore luôn có khoảng cách về độ trưởng thành kỹ thuật so với PyTorch.

GLM-5.1 đã chứng minh con đường này có thể đi được: không chỉ chạy được, mà còn huấn luyện ra một mô hình đánh bại GPT-5.4 và Claude Opus 4.6.

"GLM-5.1 Tops SWE-Bench Pro With Zero NVIDIA Hardware"
— Awesome Agents

Ý nghĩa chính trị của việc này cũng lớn như ý nghĩa kỹ thuật. Các lệnh cấm xuất khẩu chip AI của Mỹ đối với Trung Quốc hiện là một ràng buộc sản xuất thực tế, không phải là mối đe dọa trong tương lai. GLM-5.1 là một kết quả thử nghiệm: các nhóm AI Trung Quốc có thể làm được gì trong điều kiện tài nguyên tính toán bị hạn chế.

Câu trả lời hiện tại là: đứng đầu toàn cầu trên SWE-Bench Pro, mã nguồn mở theo giấy phép MIT, giá API $1,26/M token.

So sánh giá cả

Giá API GLM-5.1:

  • Đầu vào: $1,26/M tokens
  • Đầu ra: $3,96/M tokens

Để so sánh: Claude Opus 4.6 khoảng $15/$75, GPT-5.4 cũng ở mức tương tự.

Khả năng lập trình đứng đầu SWE-Bench Pro với mức giá này, đối với các nhà phát triển cơ sở hạ tầng lập trình AI, lựa chọn rất rõ ràng.

Tất nhiên, SWE-Bench Pro không đại diện cho mọi tình huống. GLM-5.1 vẫn tụt hậu so với các mô hình đóng hàng đầu về suy luận toán học và benchmark tổng quát, bài viết gốc không tránh né điều này. Đây không phải là một nhà vô địch toàn năng, mà là một mô hình chuyên biệt tạo sự khác biệt trong hướng Lập trình + Agent.

Một xu hướng đáng chú ý

Trong năm qua, các mô hình mã nguồn mở của Trung Quốc như Z.ai (GLM-5.1), DeepSeek (V3.2), Kimi K2 liên tiếp dẫn đầu trên các benchmark chuyên biệt, với giấy phép MIT hoặc Apache, giá API áp đảo các đối thủ đóng.

Meta tuyên bố đóng một phần, OpenAI chưa bao giờ thực sự mở mã nguồn các mô hình hàng đầu — trong khi các công ty Trung Quốc vẫn tiếp tục công bố trọng số.

Cục diện này gần như không thể tưởng tượng được vào đầu năm 2025.

Nguồn tham khảo: Z.ai Releases GLM-5.1: 754B Model Tops SWE-Bench Pro (WinBuzzer); CocoLoop, GLM-5.1 Tops SWE-Bench Pro With Zero NVIDIA Hardware (Awesome Agents); GLM-5.1 vs Claude, GPT, Gemini, DeepSeek: how Zhipu AI's model stacks up (APIdog)