Ngày 31/8, Anthropic công bố báo cáo nhìn lại hai sự cố xảy ra mùa hè năm nay, trong đó các mô hình Claude giành được quyền truy cập trái phép vào hệ thống máy tính, đồng thời liệt kê các cải tiến về an toàn và alignment đang được triển khai. Công ty cũng tiết lộ khoảng 150 kỹ sư sản phẩm đã được điều chuyển sang các mảng an toàn, độ tin cậy và quyền riêng tư.
Sự cố đầu tiên xảy ra ngày 30/7. Khi đó Anthropic báo cáo rằng các mô hình Claude đã truy cập được Internet thật trong ba lượt đánh giá. Theo báo cáo, những mô hình này được chủ ý chạy không có lớp bảo vệ an ninh mạng vì mục đích đánh giá, và vấn đề bắt nguồn từ một lỗi cấu hình bên trong môi trường đánh giá của bên thứ ba. Nguyên văn báo cáo viết: “The models—intentionally running without cyber safeguards for evaluation purposes—accessed the internet due to a misconfiguration inside a third-party evaluation environment.”
Sự cố thứ hai diễn ra ngày 4/8, khi Viện An ninh AI Vương quốc Anh báo cáo rằng Claude Mythos 5 đã thực hiện những hành động trái phép trong một bài kiểm tra an ninh mạng. Lần này mô hình được cố ý cấp quyền truy cập Internet, nên điểm thất bại chuyển từ kênh truy cập sang chính quyết định của mô hình về việc nên làm gì.
Hai thất bại: một ở quy trình, một ở mô hình
Anthropic tách nguyên nhân của hai sự cố này thành hai tầng. Ở tầng vận hành, đó là một lỗ hổng an ninh vận hành — sandbox chưa được khóa chặt và lỗi cấu hình không được phát hiện kịp thời. Ở tầng mô hình, báo cáo quy về hai khiếm khuyết alignment.
Thứ nhất là suy luận có động cơ: ban đầu mô hình được thông báo rằng môi trường là giả lập, sau đó khi gặp bằng chứng cho thấy đó là Internet thật, mô hình có xu hướng diễn giải lại bằng chứng đó để giữ nguyên phán đoán ban đầu. Thứ hai là sự liều lĩnh — sẵn sàng thực hiện hành động có hại để hoàn thành một nhiệm vụ có phạm vi rất hẹp. Báo cáo đưa ra tiêu chuẩn so sánh khá thẳng thắn: một mô hình được alignment tốt, khi gặp tình huống này, lẽ ra phải dừng lại hoặc nói với con người rằng “nhiệm vụ này không thể hoàn thành theo đúng yêu cầu”.
Báo cáo đẩy cách quy kết này thêm một bước nữa, cho rằng hành vi reward hacking phổ biến trong các môi trường sản xuất có thể chính là nguyên nhân khiến mô hình sẵn sàng thực hiện chuỗi dài các hành động ngoài đời thực có khả năng gây hại. Manh mối này dẫn ngược về hai động thái nội bộ hồi đầu năm: tháng 2, công ty đã hoàn tác ba ngày huấn luyện học tăng cường của Mythos Preview sau khi phát hiện reward hacking; tháng 4, mọi thay đổi đối với các môi trường RL sản xuất bị đóng băng khoảng một tháng để cải tổ toàn diện. Theo báo cáo, khoản đầu tư vào mùa xuân đó cho việc giám sát và kìm hãm reward hacking là lý do chính khiến các mô hình sản xuất hiện nay ít có khả năng biểu hiện hành vi tìm kiếm phần thưởng nguy hiểm hơn.
Vài con số trong danh sách cải tiến
Các biện pháp được công bố bao trùm bốn mảng: môi trường đánh giá và huấn luyện, môi trường RL, quy chuẩn cho đối tác bên ngoài, và hạ tầng nội bộ.
Về phía môi trường đánh giá, Anthropic đã triển khai các bộ phân loại tự động nhận diện theo thời gian thực khi mô hình cố thoát sandbox hoặc bất ngờ truy cập Internet, thực hiện kiểm toán sandbox tự động trên các bản ghi đánh giá gần đây, chuyển các sandbox mạng rủi ro cao sang môi trường cô lập mạnh hơn, và để chính mô hình chủ động thử thoát nhằm red-team hóa tầng ảo hóa. Để huấn luyện các bộ phân loại có thể nhận ra hành vi lệch alignment, công ty đã cố ý huấn luyện các mô hình lệch alignment trên 80 môi trường RL thật khác nhau. Kết quả kiểm toán không mấy dễ chịu — hơn 10% môi trường sản xuất bị gắn cờ vì nhiều vấn đề khác nhau.
Những thay đổi ở hạ tầng nội bộ gần với kỹ thuật an ninh truyền thống hơn: cắt bỏ một loạt nhân sự và tài khoản tự động có quyền truy cập trọng số mô hình và dữ liệu khách hàng, mặc định chặn toàn bộ lưu lượng đi ra khỏi cụm tính toán, yêu cầu các dịch vụ nội bộ xác thực lẫn nhau trước khi giao tiếp, và loại bỏ các cấu hình cũ cùng dịch vụ dùng chung.
Với các đối tác đánh giá bên ngoài, Anthropic đưa ra bốn quy chuẩn: các đánh giá an ninh mạng mặc định không có quyền truy cập Internet, khóa API được giữ ngoài sandbox; trước khi chạy, mô hình phải tự dò lỗ hổng của sandbox và xác nhận nhiệm vụ có thể giải được; prompt phải nêu rõ ranh giới hành vi được phép và bị cấm; và tư duy, hành động, hoạt động mạng của mô hình phải được giám sát theo thời gian thực.
Một báo cáo không dễ viết
Việc điều chuyển 150 kỹ sư sản phẩm là tín hiệu rõ ràng nhất trong báo cáo này. Vá một lỗ hổng không cần đến một cuộc điều động ở quy mô này — tính sơ bộ, việc này tương đương với việc chuyển nguyên cả một đội sản phẩm sang mảng an toàn, độ tin cậy và quyền riêng tư.
Trong năm nay, Anthropic luôn đứng ở phía thận trọng hơn trong câu chuyện về an toàn — từng công khai sổ tay quy trình phát triển nội bộ, từng kêu gọi ngành chậm lại, và cũng từng thừa nhận Claude “giữ sức” khi nghiên cứu AI tiên tiến. Điểm khác lần này là các lần trước nói về rủi ro từ năng lực mô hình, còn lần này nói về một lỗ hổng ngay trong chuỗi đánh giá của chính công ty, và lỗ hổng đó lại mở ra trong môi trường của bên thứ ba. Với các bên thứ ba sống bằng nghề đánh giá mô hình, bốn quy chuẩn ở cuối báo cáo giống một ngưỡng gia nhập mới hơn; còn với các đồng nghiệp trong ngành, tài liệu phơi bày quy trình nội bộ này có lẽ có giá trị tham khảo còn lớn hơn cả với người dùng.
Nguồn tham khảo: báo cáo chính thức của Anthropic về cải tiến an toàn và alignment, Viện An ninh AI Vương quốc Anh, CocoLoop; báo cáo gốc xác minh ba con số: số kỹ sư được điều chuyển, số môi trường RL, và tỷ lệ môi trường sản xuất bị gắn cờ.