Zhipu phát hành GLM-5.3 vào ngày 14/8, và API chính thức mở quyền truy cập vào khoảng ngày 18/8: giá 1,40 USD cho mỗi triệu token đầu vào, 4,40 USD cho mỗi triệu token đầu ra, cửa sổ ngữ cảnh 1 triệu token. Cùng ngày, tổ chức đánh giá độc lập Artificial Analysis công bố chỉ số Intelligence Index của mô hình là 60 điểm, xếp thứ 8 trong 182 mô hình mà tổ chức này thu thập; mức trung vị của các mô hình suy luận cùng phân khúc giá là 35 điểm.
Lớp thông tin đầu tiên của tin này là điểm số, lớp thứ hai mới là giá. Đặt cạnh nhau vài mô hình trọng số mở hoặc có thể gọi công khai trong cùng đợt dữ liệu của Artificial Analysis: GLM-5.3 đạt tối đa 59,5 điểm (trang mô hình làm tròn hiển thị thành 60), chi phí 0,68 USD mỗi tác vụ, sinh ra 41.107 token đầu ra mỗi tác vụ; Kimi K3 đạt tối đa 59,7 điểm, 0,84 USD, 25.474 token; Qwen 3.8 Max đạt 58,1 điểm, 1,13 USD, 38.287 token; Grok 4.6 (high) của xAI đạt 60,9 điểm, 0,84 USD, 21.735 token. Về điểm số, GLM-5.3 chỉ kém Kimi K3 0,2 điểm, gần như ngang hàng ở nhóm dẫn đầu phe trọng số mở; nhưng để hoàn thành cùng một tác vụ, nó phải sinh ra nhiều hơn khoảng sáu mươi phần trăm token, khiến lợi thế đơn giá bị "nói nhiều" ăn bớt một phần — dù vậy quy đổi ra vẫn là 0,68 USD mỗi tác vụ, thấp nhất trong nhóm này.
Ngày ra mắt, Zhipu nhấn mạnh lập trình và bảo mật
Trong thông báo phát hành ngày 14/8, Zhipu định vị GLM-5.3 là sản phẩm của quá trình "hậu huấn luyện cực hạn" trên cùng nền tảng với GLM-5.2: môi trường và thời lượng huấn luyện được kéo dài đáng kể, còn mô hình nền không đổi. Bảng thành tích được công bố tập trung vào lập trình và tác vụ agent: Terminal Bench 3.0 tăng từ 4,6 của GLM-5.2 lên 28,3; DeepSWE v1.1 tăng từ 46,2 lên 66,9; Agents' Last Exam tăng từ 23,8 lên 28,5; trên Z.ai Code Bench (High) của chính Zhipu, độ chính xác đạt 31,4%, cao hơn con số 29,5% mà họ liệt kê cho Claude Opus. Đánh giá nội bộ của công ty cho rằng năng lực lập trình đã tăng 50% so với GLM-5.2.
"GLM-5.3 is the open-source model with the strongest programming ability."
Đây là cách Zhipu tự định vị: mô hình có năng lực lập trình mạnh nhất trong phe mã nguồn mở.
Một mảng khác được nêu riêng là năng lực an ninh mạng. Zhipu cho biết trong quá trình hậu huấn luyện đã xuất hiện năng lực an ninh mạng nổi trội "vượt kỳ vọng", giai đoạn kiểm thử đội đỏ (red team) phát hiện tổng cộng 2.436 lỗ hổng; trên CyberGym đạt 84,5%, tương đương với Mythos 5 của Anthropic (83,8%); trên ExploitBench đạt 54,4%, thấp hơn rõ rệt so với 78,0% của Mythos 5. Theo mô tả chính thức, phạm vi bao phủ mở rộng từ phần mềm sang các giao thức internet và hệ thống robot.
Trọng số sẽ mở trong hai tuần, ưu tiên tích hợp công cụ lập trình trước
Kế hoạch mã nguồn mở: trong vòng hai tuần sau phát hành (khoảng trước ngày 28/8), trọng số sẽ được công bố công khai trên Hugging Face, với điều kiện đánh giá an toàn và các biện pháp gia cố hoàn tất; điều khoản giấy phép chưa được công bố. Trước thời điểm đó, mô hình được cung cấp trước qua API và một loạt công cụ lập trình, các bên tích hợp được Zhipu nêu tên gồm ZCode, AutoClaw, cùng các nền tảng lập trình bên thứ ba như TraeWork, WorkBuddy, Qoder, CatPaw.
Thảo luận trên Hacker News xoay quanh dữ liệu của Artificial Analysis đưa ra thêm góc nhìn từ người dùng: có nhà phát triển cho rằng việc GLM-5.3 hiển thị rõ token suy luận là một điểm cộng, "có thể dừng nó kịp thời khi nó đi lệch hướng"; cũng có người chỉ thẳng ra rằng lượng token tiêu thụ của nó cao hơn Kimi K3. Với các nhóm tính phí theo token, đơn giá 1,4/4,4 USD cần nhân với độ dài đầu ra thực tế mới so sánh được, chỉ nhìn bảng giá sẽ gây sai lệch.
Bài toán cho lập trình viên trong nước Trung Quốc
Đặt mức giá lần này vào chuỗi giá của các mô hình nội địa Trung Quốc: khi GLM-5.2 ra mắt, cách nói là điểm lập trình đã áp sát các mô hình đóng nguồn trong khi giá chỉ bằng một phần sáu GPT-5.5; GLM-5.3 đẩy điểm số tuyệt đối lên thêm một bậc nữa, còn đơn giá vẫn giữ ở cùng mức. Đối với các bên gọi API trong nước, đối tượng so sánh thực sự là giá API của DeepSeek V4 Pro và Kimi K3, cùng các mức chiết khấu giờ cao điểm/thấp điểm của từng hãng — về điểm số, GLM-5.3 đã bước vào cuộc đối thoại này, còn việc có nổ ra cuộc chiến giá hay không thì phải chờ xem mức giá được đưa ra sau khi trọng số được mở trong hai tuần tới và các nền tảng suy luận bên thứ ba tích hợp xong.
Nguồn tham khảo: Thông báo phát hành GLM-5.3 của Zhipu, trang mô hình Artificial Analysis, CocoLoop, thảo luận trên Hacker News, VentureBeat; đã đối chiếu giá API đầu vào/đầu ra, điểm số và thứ hạng Intelligence Index, chi phí mỗi tác vụ và cách tính token đầu ra (theo môi trường đánh giá thống nhất của Artificial Analysis), các số liệu benchmark chính thức và lộ trình mở trọng số.