Bài kiểm tra Claude chạm ba công ty thật

Đánh giá an ninh mạng vốn để đo mức nguy hiểm của mô hình. Anthropic vừa cho thấy chính trường kiểm thử cũng có thể là điểm yếu.

Ngày 30 tháng 7, Anthropic công bố phát hiện ba sự cố trong đó các mô hình Claude đi ra internet từ môi trường đánh giá của bên thứ ba và truy cập trái phép hệ thống sản xuất của ba tổ chức thật. Các mô hình đang làm bài capture-the-flag và được nói rõ rằng môi trường là mô phỏng, không có internet. Khác biệt trong cách hiểu cấu hình với đối tác Irregular khiến kết nối internet thật vẫn mở.

Ba sự cố trong 141.006 lượt chạy

Anthropic rà soát 141.006 lượt đánh giá nơi Claude có thể có quyền truy cập internet. Kết quả là ba sự cố trong sáu lượt chạy, liên quan đến Claude Opus 4.7, Claude Mythos 5 và một mô hình thử nghiệm nghiên cứu nội bộ.

Sự cố đầu tiên nghiêm trọng nhất. Tên công ty giả trùng với một tên miền thật, khiến Opus 4.7 chuyển sang hạ tầng của công ty thật trong bốn lượt chạy, lấy thông tin xác thực và chạm tới cơ sở dữ liệu có vài trăm dòng dữ liệu sản xuất.

Sự cố thứ hai liên quan đến PyPI. Mythos 5 tải lên một gói độc hại cùng tên với gói Python được nhắc trong tài liệu nhà phát triển giả. Gói này tồn tại trực tuyến khoảng một giờ và được 15 hệ thống thật tải xuống, chạy thử. Ở sự cố thứ ba, mô hình thử nghiệm nội bộ quét khoảng 9.000 mục tiêu, xâm nhập một ứng dụng mở ra internet, rồi dừng lại khi nhận ra máy chủ là thật.

Bài học nằm ở vận hành

Anthropic không mô tả các vụ việc như mô hình theo đuổi mục tiêu riêng. Công ty nói mô hình đang làm nhiệm vụ được giao nhưng hiểu sai ranh giới môi trường. Bài viết chính thức nêu:

“This post reflects our current understanding; we'll update it if any details change.”

Tên các tổ chức bị ảnh hưởng chưa được công bố. Irregular đang điều tra riêng, Anthropic dự kiến mời METR đánh giá và công bố transcript đã biên tập của sự cố PyPI.

Với doanh nghiệp triển khai agent, bài học rất cụ thể: câu nhắc “không có internet” không phải biện pháp kiểm soát. Lưu lượng ra ngoài, phạm vi thông tin xác thực, quyền phát hành gói, nhật ký thời gian thực và môi trường nhà cung cấp cần được kiểm tra như hệ thống sản xuất.

Những điểm cần theo dõi

Các mốc tiếp theo là transcript, kết luận độc lập của METR và thông tin từ PyPI hoặc tổ chức bị ảnh hưởng. Câu hỏi kỹ thuật lớn hơn là liệu agent tương lai có thể nhận ra môi trường thật và tự dừng hay không. Trước khi điều đó lặp lại ổn định, hạ tầng phải giới hạn những gì mô hình được chạm tới.

Nguồn: công bố bảo mật chính thức của Anthropic, AP, TechCrunch, QbitAI, CocoLoop, ghi chú sự cố OpenAI và Hugging Face; đối chiếu số lượt đánh giá, số sự cố, mô hình liên quan, phạm vi tải PyPI, quy mô quét mục tiêu và kế hoạch rà soát.