Zhipu mã nguồn mở GLM-5.3-Flash, tham số kích hoạt giảm còn 18 tỷ

Ngày 26 tháng 8, Zhipu đã "lột mặt nạ" cho Ox Alpha — mô hình đã chạy ẩn danh hơn một tuần trên OpenCode và OpenRouter. Tên chính thức của nó là GLM-5.3-Flash, trọng số được đăng lên HuggingFace ngay trong ngày, theo giấy phép MIT.

Đây là thành viên đa phương thức nguyên sinh đầu tiên trong dòng GLM-5. Tổng số tham số là 320 tỷ, nhưng mỗi token chỉ kích hoạt 18 tỷ; số lớp giảm từ 92 lớp của GLM-5.3 xuống còn 45 lớp, tham số kích hoạt giảm từ 32 tỷ của thế hệ trước xuống 18 tỷ. Phần tính toán tiết kiệm được thể hiện trực tiếp trên giá: giá niêm yết chính thức chỉ bằng khoảng một phần mười so với GLM-5.3, trong thời gian khuyến mãi có hạn còn giảm thêm một nửa nữa, quy đổi ra chỉ bằng khoảng một phần bốn mươi Claude Opus 4.8. Theo một cách tính khác của Z.ai, ở mức giá khuyến mãi, chi phí trung bình để hoàn thành một tác vụ là 0,045 USD.

Tham số giảm một nửa, điểm số không giảm theo

Trên chỉ số trí tuệ v4.1.1 của Artificial Analysis, GLM-5.3-Flash đạt 57 điểm, lọt vào nhóm mô hình tiên phong toàn cầu, cùng đẳng cấp với Opus 4.8 — mô hình đang được ưa chuộng nhất của Anthropic hiện nay. Khoảng cách giữa các bài kiểm tra thành phần lớn hơn nhiều: DeepSWE v1.1 tăng từ 46,2 điểm của GLM-5.2 lên 63,4; Terminal-Bench 2.1 đạt 84,3; Toolathlon Verified đạt 78,4; AutomationBench v1.0.6 đạt 48,8. Z.ai Code Bench của chính Zhipu, ở mức độ khó cao nhất, cho kết quả 29,0, trong khi nhóm đối chứng Opus đạt 29,5.

Đa phương thức là phần mới được bổ sung ở thế hệ này: OfficeQA Pro đạt 62,4, CharXiv kèm suy luận công cụ đạt 89,4, Chartography kèm công cụ đạt 78,0, mảng video có MVBench đạt 77,8 và MMVU đạt 80,5. Tổ hợp điểm số này cho thấy hướng đến "agent văn phòng biết đọc bảng biểu và bản vẽ" hơn là một cuộc trình diễn điểm số về hiểu ảnh tổng quát.

Về kiến trúc, đây là mô hình mã nguồn mở tiên phong đầu tiên kết hợp cả cơ chế attention thưa (sparse attention) và attention tuyến tính (linear attention), đồng thời đưa vào IndexPool và mHC (siêu kết nối ràng buộc đa tạp). Hiệu quả thể hiện ở hai con số: so với GLM-5.3, khối lượng tính toán attention giảm còn khoảng một phần ba (giảm 3,0 lần), KV cache giảm còn khoảng một phần tư (giảm 4,4 lần). Chi phí lớn nhất của ngữ cảnh dài nằm ở KV cache, tỷ lệ này quyết định việc cửa sổ ngữ cảnh 1 triệu token có thực sự dùng được hay chỉ nằm trên bảng thông số.

Toàn bộ lưu lượng chạy trên chip AI nội địa

Trong giai đoạn thử nghiệm ẩn danh, Ox Alpha có lúc là mô hình được gọi nhiều nhất trên OpenCode. Zhipu cho biết toàn bộ lưu lượng suy luận trong giai đoạn này được xử lý bằng chip AI nội địa Trung Quốc, hiệu năng dịch vụ đầu-cuối đã tăng gấp 3 lần so với trước, chi phí đã có thể ngang bằng với các giải pháp GPU Nvidia chủ đạo.

Thông tin này không kém giá trị so với các con số điểm số. Câu chuyện phổ biến của các mô hình mã nguồn mở Trung Quốc trong năm qua là "điểm số gần bằng nhưng triển khai vẫn phải dựa vào card dòng H"; một khi phía suy luận có thể chạy hết công suất trên chip nội địa với chi phí đơn vị ngang bằng, không gian định giá của các hãng mô hình sẽ không còn bị giới hạn bởi giá mua card. Việc GLM-5.3-Flash dám hạ giá niêm yết xuống còn một phần mười so với thế hệ trước, một nửa sự tự tin đó nằm ở đây.

Tính nhẩm một phép toán: theo giá khuyến mãi có hạn 0,075 USD cho mỗi triệu token đầu vào, 0,25 USD cho mỗi triệu token đầu ra, một ứng dụng Agent cỡ vừa tiêu thụ trung bình 50 triệu token đầu vào và 10 triệu token đầu ra mỗi ngày sẽ có hóa đơn mô hình khoảng 6,25 USD/ngày (tính nhẩm, chưa tính chiết khấu cache và chi phí thử lại khi lỗi). Với cùng lưu lượng gọi đó trên Opus 4.8, chênh lệch là cả một bậc độ lớn. Đối với các đội làm sản phẩm Agent trong nước, điều này kéo câu hỏi "có đưa được vào sản xuất hay không" từ vấn đề ngân sách trở lại thành vấn đề kỹ thuật.

Về triển khai, SGLang, vLLM, KTransformers đều đã hỗ trợ, API cũng đồng thời lên trên docs.z.ai. Giấy phép MIT là một bước hiếm thấy lần này — các thế hệ GLM trước phần lớn dùng giấy phép riêng của hãng, còn dưới MIT thì việc phân phối lại thương mại gần như không kèm điều kiện phụ, các đội ở nước ngoài lấy về chỉnh sửa cũng không cần qua khâu pháp lý nữa.

Một tuần trước đó, Zhipu vừa công khai thừa nhận Ox Alpha là bản lặp của chính mình, khi đó số liệu đưa ra là lưu lượng gọi vượt DeepSeek hơn hai lần. Giờ đây tên gọi, trọng số, giá cả cả ba đã được đặt lên bàn, vấn đề còn lại là có bao nhiêu đội sẵn sàng chuyển nó từ "mô hình thử nghiệm giá rẻ" thành trụ cột chính thức.

Nguồn tham khảo: blog chính thức của Z.ai, trang mô hình trên HuggingFace, CocoLoop, Artificial Analysis; quy mô tham số, điểm chuẩn và đơn giá API được đối chiếu theo trang phát hành chính thức.