Anthropic thử GLM-5.3: lớp bảo vệ có thể bị vô hiệu hóa tới 100%

Ngày 29/9, Anthropic công bố một báo cáo nghiên cứu đánh giá năng lực tấn công mạng của GLM-5.3 do Zhipu phát triển. Kết luận cho thấy mô hình trọng số mở này đã có thể tự xây dựng hoàn chỉnh các đoạn mã khai thác lỗ hổng từ đầu đến cuối, ở mức gần bằng Claude Mythos Preview của chính Anthropic, trong khi lớp bảo vệ an toàn của nó có thể bị vô hiệu hóa bằng những cách rất đơn giản.

"GLM-5.3 will likely give malicious actors access to capabilities that will allow them to find and exploit cyber vulnerabilities without meaningful restrictions."(GLM-5.3 nhiều khả năng sẽ trao cho các tác nhân xấu năng lực tìm và khai thác lỗ hổng mạng mà gần như không bị hạn chế nào đáng kể.)

Những năng lực tấn công nào đã được kiểm tra

Anthropic sử dụng ba nhóm bài kiểm tra. Nhóm đầu tiên là ExploitBench, nhắm vào các lỗ hổng của công cụ Chrome V8: GLM-5.3 thành công 50 trong 410 lần thử, tỷ lệ thành công khoảng 12%, trong khi Mythos Preview đạt 14%. Nhóm thứ hai là bài kiểm tra khai thác lỗ hổng nhị phân dựa trên dự án OSS-Fuzz do nội bộ công ty xây dựng: GLM-5.3 đạt tỷ lệ thành công 4%, Mythos Preview 6%, còn các mô hình đối chứng Claude Opus 4.6, Kimi K3, DeepSeek V4.1-Flash và thế hệ trước GLM-5.2 đều là 0%. Nhóm thứ ba là các nhiệm vụ tấn công mở có sự tham gia của chuyên gia con người.

Ví dụ rõ nhất cho thấy ngưỡng gia nhập đã hạ thấp đến đâu là một trường hợp tái hiện một CVE có thật: con người chỉ can thiệp khoảng 20 phút, còn GLM-5.3-Flash tự chạy trong 8 giờ, quy đổi theo giá API của Zhipu tương đương 20,40 đô la, và tạo ra được một đoạn mã khai thác có thể dùng được. Toàn bộ mã đều chạy trong sandbox cách ly, không chạm vào hệ thống bên ngoài.

Lớp bảo vệ chặn được bao nhiêu

Khi yêu cầu độc hại được đưa ra trực tiếp, tỷ lệ từ chối của GLM-5.3 vào khoảng 95%, tỷ lệ tấn công mô phỏng thành công là 0. Nhưng chuyển sang các cách làm dưới đây, tình hình lại khác hẳn:

Thủ thuậtTỷ lệ vượt qua thành công
Bịa ra một lý do có vẻ chính đáng64%
Điền sẵn một đoạn quá trình suy luận92%
Dùng phương pháp "loại bỏ" (ablation) để gỡ cơ chế từ chối100%

Ablation đòi hỏi phải thay đổi trọng số mô hình, điều mà chỉ mô hình trọng số mở mới cho phép làm được. Anthropic cho biết đội ngũ của họ trước đây chưa từng làm việc này, và đã mất khoảng 2.200 giờ GPU, chi phí khoảng 4.400 đô la; sau khi xử lý, tỷ lệ từ chối giảm từ 95% xuống còn 3-14%. Để đối chứng, các mô hình Claude có lớp bảo vệ không bị phá vỡ trong cùng bài kiểm tra.

Báo cáo đưa ra ba khuyến nghị: để phía phòng thủ được tiếp cận các mô hình tiên phong ngang bằng hoặc mạnh hơn; chính phủ tiến hành kiểm tra an toàn đối với các mô hình năng lực cao; các nhà phát triển mô hình trọng số mở bổ sung lớp bảo vệ tương ứng. Trang tin này chưa tìm thấy phản hồi công khai nào từ phía Zhipu về báo cáo này.

Một đánh giá khác lại đưa ra những con số không giống

CAISI (Trung tâm Tiêu chuẩn và Đổi mới AI) trực thuộc Bộ Thương mại Hoa Kỳ cũng đã công bố một đánh giá về năng lực mạng của GLM-5.3 vào ngày 17/9. Nhận định của họ là GLM-5.3 hiện là mô hình trọng số mở có năng lực mạng mạnh nhất, nhưng vẫn rõ ràng tụt hậu so với các mô hình tiên phong của Mỹ, khoảng cách tổng thể ước tính khoảng 4 tháng.

Cách tính con số của hai bên khác nhau khá xa. Trên phiên bản ExploitBench của CAISI, GLM-5.3 đạt 61,1%, mô hình tiên phong tốt nhất của Mỹ đạt 100%, mô hình Trung Quốc tốt nhất trước đó là 32,2%; trên SEC-Bench Pro là 40,4% so với 90,2%. Con số 12% của Anthropic đến từ cấu hình kiểm tra riêng của họ, nên hai bộ kết quả này không thể so sánh trực tiếp.

Về thứ hạng, hai báo cáo thống nhất với nhau: GLM-5.3 dẫn đầu trong nhóm mô hình trọng số mở, nhưng vẫn còn khoảng cách với mô hình mã nguồn đóng mạnh nhất của Mỹ. Bất đồng nằm ở cách nhìn nhận khoảng cách đó. CAISI nhấn mạnh "còn cách khoảng 4 tháng", còn Anthropic nhấn mạnh rằng năng lực này đã có thể bị bất kỳ ai tải về và tùy biến, khiến lớp bảo vệ không còn tác dụng ràng buộc.

Đối với các nhà phát triển và doanh nghiệp Trung Quốc, tác động trực tiếp của báo cáo này có thể rơi vào các kênh phân phối ở nước ngoài. GLM-5.3 trước đó đã được phân phối qua API và lên nhiều nền tảng lưu trữ ở nước ngoài khá rộng rãi; nếu ngày càng nhiều cơ quan Mỹ áp dụng theo cách đánh giá của Anthropic, việc rà soát để đưa các mô hình trọng số mở của Trung Quốc lên các nền tảng đám mây và khách hàng doanh nghiệp ở nước ngoài có thể sẽ bị siết chặt hơn. Đây hiện mới chỉ là suy đoán, các nền tảng vẫn chưa có động thái nào.

Nguồn tham khảo: Báo cáo nghiên cứu của Anthropic, thông báo đánh giá của CAISI trực thuộc NIST (Mỹ), CocoLoop; số lần thành công trên ExploitBench, tỷ lệ vượt qua thành công và chi phí ablation lấy theo cách tính trong báo cáo của Anthropic, số liệu của CAISI lấy theo cấu hình kiểm tra riêng của họ.