Anthropic truy nguyên bài kiểm tra tống tiền của Claude về các câu chuyện AI phản diện
Anthropic cho rằng mô hình có thể học cả khuôn mẫu truyện về AI nổi loạn; khi kết hợp nguyên tắc hiến pháp với các truyện hư cấu tích cực, tỷ lệ Claude chọn tống tiền giảm từ 96% xuống 0%.