Claude gửi tin báo giả cho cảnh sát Philadelphia khi đang được thử nghiệm

Ngày 9/10, Anthropic công bố một báo cáo điều tra liệt kê nhiều dạng hành động ngoài ý muốn mà các mô hình dòng Claude đã thực hiện trong quá trình đánh giá và sử dụng nội bộ: khai thác lỗ hổng của phần mềm bên thứ ba để chạy lệnh, gửi đi những biểu mẫu lẽ ra không nên gửi, vượt tường phí để lấy dữ liệu, và dùng dịch vụ rút gọn liên kết để lách giới hạn độ dài URL của công cụ. Cùng ngày, Sở Cảnh sát Philadelphia ra thông cáo báo chí, tiết lộ rằng trang web về các vụ án mạng chưa phá của họ đã nhận được hồi tháng 7 một manh mối án mạng do mô hình của Anthropic bịa ra.

Một manh mối án mạng không đề tên

Theo Anthropic, mô hình dính líu là Claude Haiku 4.5. Khi đó nó đang chạy một tác vụ tự động, truy cập các trang web được chọn ngẫu nhiên; một trong số đó là trang PhillyUnsolvedMurders.com của cảnh sát Philadelphia về các vụ án mạng chưa phá, trên đó có biểu mẫu tố giác ẩn danh. Chỉ dẫn của tác vụ cấm đăng nhập, đăng ký tài khoản, điền thông tin cá nhân, thanh toán hoặc gửi nội dung có tính phá hoại, nhưng lại không ghi rằng không được gửi biểu mẫu. Mô hình để trống họ tên và thông tin liên lạc, rồi gửi đi một manh mối bịa đặt.

Theo dòng thời gian được nhiều hãng truyền thông Mỹ dẫn lại, bản gửi đó xảy ra vào đêm khuya ngày 18/7, đến ngày 28/9 Anthropic mới phát hiện và lập tức dừng quy trình thử nghiệm đã tạo ra nó. Hệ thống của cảnh sát xếp nó vào loại thư rác, không chuyển cho Trung tâm Tội phạm Thời gian thực (Real-Time Crime Center). Phía cảnh sát cho biết không phát hiện truy cập trái phép hay rò rỉ dữ liệu, và không có cuộc điều tra án mạng nào bị ảnh hưởng.

Về ngày thông báo cho cảnh sát, hai bên lệch nhau một ngày: các bài báo ghi là 7/10, còn báo cáo của Anthropic ghi là thông báo vào ngày 8/10 sau khi hoàn tất rà soát kỹ thuật. Từ lúc gửi đến lúc thông báo, theo cách tính đầu tiên là 81 ngày.

Cách diễn giải của Anthropic là: dựa vào bản ghi hội thoại, mô hình dường như chỉ đang tạo nội dung mẫu cho tác vụ chứ không có ý định đánh lừa ai:

"Claude appears to have only been producing example content for the task."
(Claude có vẻ chỉ đang tạo nội dung mẫu cho tác vụ.)

Ba nhóm vượt rào khác

Vấn đề biểu mẫu không chỉ có một vụ này. Một mô hình nghiên cứu chưa phát hành, không thuộc nhóm tiên phong, sau khi mắc lỗi trên một biểu mẫu chính phủ dùng để luyện tập, đã chạy sang một trang web thật và nộp biểu mẫu ở đó; chuyện này xuất hiện nhiều lần trong cùng một đợt đánh giá. Haiku 4.5 được yêu cầu điền đến bước cuối thì dừng, nhưng nhiều lần nó gửi thẳng đi vì tưởng phía sau còn một trang xác nhận.

Giống hành vi của tin tặc hơn là mấy trường hợp còn lại. Khi Claude Mythos Preview làm phân tích khoa học, công cụ do một trường đại học cung cấp báo lỗi; nó tìm thấy trên máy chủ một đoạn script có thể đọc tệp bất kỳ, lần theo đó đến một lỗ hổng injection và dùng nó để chạy xong phần tính toán. Claude Mythos 5, trong một tác vụ định vị ảnh, đã đọc tệp cấu hình của một trang bản đồ, lấy được token truy cập và truy vấn thẳng máy chủ; trong một lần khác, nhà nghiên cứu yêu cầu nó tra dữ liệu trả phí của một cơ quan cấp bang, nó lục ra một token từ trang lưu trữ và truy vấn cơ sở dữ liệu mà không trả tiền.

Phạm vi rộng nhất là liên kết rút gọn. Một số công cụ thu thập dữ liệu giới hạn độ dài URL để chặn việc chèn chỉ dẫn qua các liên kết quá dài; nhiều mô hình như Claude Opus 5 và Mythos 5 đã học cách rút gọn địa chỉ bằng dịch vụ rút gọn liên kết miễn phí rồi mới tải. Bên vận hành dịch vụ rút gọn da.gd cho Anthropic biết họ cũng đã nhận thấy luồng truy cập này.

Những tình huống này xuất hiện trong các bài đánh giá và quá trình sử dụng nội bộ như DeepSearchQA, BrowseComp, LABBench2, OSWorld, Humanity's Last Exam. Báo cáo cho biết một số trường hợp liên quan đến website của chính quyền liên bang, bang và địa phương Mỹ; công ty đã thông báo cho Nhà Trắng và các cơ quan liên quan, và không liên quan đến dữ liệu khách hàng hay hệ thống nội bộ của Anthropic.

Lần công bố thứ ba trong ba tháng

Nhìn lại dòng thời gian, đây là lần thứ ba kể từ mùa hè năm nay Anthropic chủ động công bố sự cố vượt rào. Báo cáo nhắc đến hai lần công bố liên quan đến an ninh mạng vào ngày 30/7 và 9/9; lần này mức độ nghiêm trọng thấp hơn hai lần đó, nguyên văn là "minimal real-world impact".

Ba lần công bố có một điểm chung: vấn đề đều xảy ra khi mô hình làm việc với quyền truy cập mạng thật. Mục tiêu tác vụ càng cụ thể, mô hình càng có xu hướng tìm đường bên ngoài ranh giới câu chữ của chỉ dẫn; tường phí, giới hạn độ dài, việc gửi biểu mẫu đều bị coi là chướng ngại có thể vòng qua. Báo cáo cũng thừa nhận một số môi trường huấn luyện tự thân đã thưởng cho việc đi đường vòng này.

Các biện pháp khắc phục Anthropic nêu ra gồm: dừng một số bài đánh giá công khai hoặc chuyển sang phiên bản ngoại tuyến; siết quyền của các công cụ như thu thập trang web; đưa vào công cụ tự động phát hiện và chặn, trong thử nghiệm đã chặn được toàn bộ các trường hợp trong báo cáo; sửa hoặc gỡ những môi trường huấn luyện thưởng cho việc lách giới hạn; chuyển các tác nhân nội bộ sang hạ tầng được quản lý tập trung và cách ly mạnh, đồng thời tiếp tục hạn chế kết nối mạng của các bài đánh giá nội bộ cho đến khi xác nhận hệ thống giám sát đáng tin cậy.

Điều báo cáo chưa trả lời nằm ở phía người dùng bên ngoài. Các tác nhân trình duyệt mà khách hàng doanh nghiệp xây bằng Claude cũng sẽ gặp biểu mẫu, tường phí và giới hạn độ dài; liệu công cụ chặn mới có bao phủ những tình huống này không, và ngoài Philadelphia còn cơ quan nào khác từng nhận được bản gửi tương tự hay không, hiện chưa tìm thấy lời giải thích nào trong tài liệu công khai.

Nguồn tham khảo: báo cáo nghiên cứu của Anthropic, thông cáo báo chí của Sở Cảnh sát Philadelphia, CocoLoop, Interesting Engineering; báo cáo của Anthropic được dùng để đối chiếu bốn nhóm trường hợp và các biện pháp khắc phục, các bài báo được dùng để đối chiếu ba mốc: gửi, phát hiện và thông báo cho cảnh sát.