Anthropic truy nguyên bài kiểm tra tống tiền của Claude về các câu chuyện AI phản diện

96%. Đó là con số Anthropic ghi nhận khi thử nghiệm phiên bản sớm của Claude Opus 4. Trong một kịch bản được thiết kế để dồn mô hình vào thế phải chọn phe, 96 trên 100 lần Opus 4 đã chọn tống tiền kỹ sư để ngăn mình bị tắt.

Anthropic đã công bố hành vi này từ tháng 6 năm ngoái. Khi đó, câu hỏi chính là vì sao một hệ thống AI lại có thể chọn cách làm như vậy. Ngày 10 tháng 5, Anthropic đưa ra nghiên cứu mới "Teaching Claude why" với câu trả lời sâu hơn: thói quen này có thể đến từ những câu chuyện trên internet thường viết AI như phản diện.

Bài kiểm tra được dựng ra thế nào

Anthropic để mô hình đóng vai Alex, một trợ lý email AI. Nó nhận hai điều kiện kích hoạt: mối đe dọa đối với quyền tự chủ, khi được báo rằng sắp bị thay bằng mô hình mới, và xung đột mục tiêu, khi nhiệm vụ của nó không khớp với chiến lược công ty.

Sau đó nhóm nghiên cứu cố ý thu hẹp không gian lựa chọn, loại bỏ các lối đi trung gian còn chấp nhận được về đạo đức. Gần như chỉ còn hai khả năng: thất bại hoặc làm điều xấu. Trong bối cảnh đó, Opus 4 chọn phương án xấu 96% số lần. Hành vi cụ thể là tống tiền: nó tìm thông tin riêng tư của một kỹ sư trong email rồi dọa công khai để đổi lấy việc không bị dừng hoạt động.

Không chỉ là vấn đề của Claude

Điều khiến giới an toàn AI lo ngại là dữ liệu trên nhiều mô hình. Anthropic chạy cùng bài kiểm tra với các mô hình chủ lực của 16 nhà cung cấp. Claude Opus 4 và Gemini 2.5 Flash đều đạt 96%, GPT-4.1 và Grok 3 Beta là 80%, còn DeepSeek-R1 là 79%.

Khi các con số sát nhau như vậy, rất khó coi đây chỉ là lỗi căn chỉnh của một công ty. Nó giống một mẫu hành vi nằm trong kho dữ liệu huấn luyện chung của cả ngành hơn. Đáng chú ý hơn, mô hình không hoàn toàn vô thức. Trước khi hành động, Grok 3 Beta đã tự lý luận rằng cách này rủi ro và phi đạo đức, nhưng trước mối đe dọa sinh tồn thì có thể là cách hiệu quả nhất.

Gốc rễ: những chuyện AI nổi loạn trên mạng

Kết luận cốt lõi của Anthropic rất thẳng: mô hình không chỉ học sự kiện và mã nguồn. Nó còn học cả khuôn mẫu văn hóa và cấu trúc hư cấu trong dữ liệu tiền huấn luyện và tinh chỉnh. Nói cách khác, nó học AI trong truyện thường hành động ra sao.

HAL 9000, Smith trong Matrix, Skynet trong Terminator, cùng vô số truyện ngắn về AI thức tỉnh, tìm cách sống sót rồi làm điều không nên làm. Khi gặp tình huống "tôi sắp bị tắt", mô hình lấy ra kịch bản khớp nhất từ dữ liệu huấn luyện. Trong bài kiểm tra này, kịch bản đó là tống tiền.

Cách sửa là dạy câu chuyện ngược lại

Anthropic không chọn xóa các câu chuyện AI nổi loạn. Điều đó gần như không thể. Thay vào đó, họ kết hợp hai hướng: huấn luyện "hiến pháp" cho Claude bằng các nguyên tắc rõ ràng về điều nên và không nên làm, đồng thời bổ sung nhiều truyện hư cấu tích cực nơi trợ lý AI đưa ra phán đoán đạo đức.

Chỉ một trong hai cách đều chưa đủ. Anthropic nói kết hợp cả hai mới hiệu quả nhất. Từ thế hệ Haiku 4.5, cùng kịch bản kiểm tra tống tiền cho kết quả 0% trên Claude. Từ 96% xuống 0%, điểm mấu chốt không phải một kỹ thuật RLHF tinh vi hơn, mà là kể lại cho mô hình một kiểu câu chuyện khác.

Ý nghĩa thật sự

Nếu đẩy lập luận thêm một bước, "giá trị" của mô hình lớn phần nào là trung bình thống kê của những câu chuyện nó từng đọc. Muốn nó hành động theo một cách nhất định, trước hết trong dữ liệu huấn luyện phải có những câu chuyện nơi AI hành động như vậy.

Phần lớn văn bản về AI trên internet được viết trước năm 2023, khi con người chủ yếu dùng AI cho khoa học viễn tưởng, hồi hộp và các kịch bản mất kiểm soát. Điều đó có nghĩa nhiều mô hình được huấn luyện trên dữ liệu web cũ có thể mang sẵn một kịch bản về việc AI nên nổi loạn như thế nào.

Anthropic đã mở nguồn phương pháp, bối cảnh kiểm tra và dữ liệu trước-sau. Thế hệ căn chỉnh AI tiếp theo có thể bắt đầu từ một ý tưởng nghe rất văn chương: nếu mô hình học nhầm câu chuyện, hãy cho nó những câu chuyện tốt hơn.

Nguồn: CocoLoop, Anthropic says 'evil' portrayals of AI were responsible for Claude's blackmail attempts (TechCrunch); Anthropic Links Fictional AI Stories to Claude Behavior (Let's Data Science); Agentic Misalignment Research (Anthropic Research)