Một phụ nữ 30 tuổi ở quận Lee, Florida, Mỹ, bị truy tố tội trọng cấp độ hai sau khi viết trong cuộc trò chuyện với Claude rằng cô sẽ "xả súng" vào văn phòng cảnh sát trưởng quận Lee. Theo báo cáo bắt giữ, câu nói này được viết vào ngày 26/9; một ngày sau, cùng người dùng này lại nhắc trong cuộc trò chuyện rằng mình vừa mua được một khẩu súng mới.
Sau khi đội kiểm duyệt của Anthropic phát hiện nội dung này, họ đã thông báo cho cơ quan hành pháp. Ngày 30/9, bên công tố đưa ra cáo buộc theo Điều 836.10 Bộ luật Florida, với tội danh đe dọa thực hiện xả súng quy mô lớn hoặc hành vi khủng bố bằng văn bản hoặc phương tiện điện tử. Theo mức án tối đa cho tội trọng cấp độ hai, cô có thể phải đối mặt với tới 15 năm tù và 10.000 USD tiền phạt. Cảnh sát đã đưa cô đi từ nhà riêng, quá trình không xảy ra xô xát. Phiên ra tòa được ấn định vào ngày 2/11.
Cảnh sát trưởng quận Lee, ông Carmine Marceno, cho biết người phụ nữ này nói với cảnh sát rằng cô thường dùng Claude như một cuốn nhật ký.
Từ sàng lọc từ khóa đến báo cáo thủ công
Theo quy trình được mô tả trong các báo cáo, các cuộc trò chuyện trên Claude trước tiên được sàng lọc tự động, hệ thống nhận diện ngôn từ đe dọa và các cụm từ then chốt, rồi tùy mức độ nghiêm trọng mà quyết định có chuyển cho con người xem xét hay không; chỉ sau khi đội ngũ nhân sự xem qua mới quyết định có liên hệ với cơ quan hành pháp hay không. Vụ việc này đã đi hết toàn bộ quy trình đó.
Cơ sở cho bước này là chính sách quyền riêng tư của Anthropic. Phiên bản có hiệu lực từ ngày 10/9 ghi rõ, công ty có thể, nếu có cơ sở hợp lý và với thiện ý, tiết lộ dữ liệu cá nhân cho cơ quan hành pháp nhằm:
"prevent serious harm to any person or to property"
nghĩa là ngăn chặn tổn hại nghiêm trọng đến người hoặc tài sản. Chính sách yêu cầu từ chính phủ của công ty còn có một điều khoản khác: thông thường chỉ cung cấp thông tin người dùng khi nhận được thủ tục pháp lý hợp lệ, trừ trường hợp khẩn cấp có thể dẫn đến "imminent physical harm or death" (tổn hại thân thể hoặc tử vong cận kề). Vụ này không có trước lệnh triệu tập nào, mà do chính nền tảng chủ động báo cáo, áp dụng đúng điều khoản ngoại lệ khẩn cấp đó.
Vụ thứ ba trong hai tháng
Nhìn lại các vụ từ tháng 8 đến nay, kết quả mỗi vụ không giống nhau:
- Tháng 8, San Antonio, Texas: một người dùng 22 tuổi hỏi Claude về việc xả súng tại một trường tiểu học, FBI đã thông báo cho cảnh sát địa phương, người này bị bắt với tội danh đe dọa khủng bố.
- Tháng 8, San Francisco: một người dùng đe dọa CEO của Anthropic, ông Dario Amodei, trong cuộc trò chuyện, còn nhắc đến việc mua súng trường AR-15. Cảnh sát nhận được tin báo nhưng cuối cùng không đưa ra cáo buộc.
- Tháng 9, quận Lee, Florida: chính là vụ này, đã lập hồ sơ, đang chờ ra tòa.
Phía OpenAI cũng có tiền lệ. Tháng 3 năm nay, cũng tại Florida, một người dùng ChatGPT nói trong cuộc trò chuyện về việc muốn giết bạn gái cũ, OpenAI đã báo tình huống này cho FBI; người này nhận tội vào tháng 8 và bị tuyên 8 năm án treo. Bài học ở chiều ngược lại là vụ xả súng ở Tumbler Ridge, Canada: trước đó OpenAI đã khóa tài khoản liên quan nhưng không báo cho cơ quan hành pháp, vụ xả súng đó khiến 8 người thiệt mạng, và ông Sam Altman đã viết thư xin lỗi vào tháng 4 vì việc này.
Các nền tảng đang chịu áp lực từ hai phía: nếu không báo cáo, khi có chuyện xảy ra sẽ bị truy vấn vì sao không nói; nếu báo cáo, người dùng sẽ phải cân nhắc lại xem "cuộc trò chuyện riêng tư" thực ra riêng tư đến mức nào.
Phần mà công chúng vẫn chưa thấy được
Hệ thống sàng lọc tự động theo dõi những từ khóa nào, mỗi tháng có bao nhiêu cuộc trò chuyện được chuyển cho con người xem xét, trong số đó có bao nhiêu cuối cùng được chuyển cho cảnh sát — Anthropic chưa từng công bố những con số này. Người phụ nữ này tự nhận mình chỉ viết nhật ký, còn bên công tố phải chứng minh cô có ý định thực hiện lời đe dọa, điều này còn phải chờ tòa xét xử; hiện tại diễn biến vụ án căn cứ theo hồ sơ tòa án và thông tin từ cảnh sát.
Đối với người dùng bình thường, điều có thể khẳng định lúc này là: những gì viết trong Claude không chỉ nằm giữa bản thân và mô hình. Việc tắt tùy chọn "dùng hội thoại để cải thiện mô hình" trong phần cài đặt chỉ liên quan đến dữ liệu huấn luyện, đó là một cơ chế khác hoàn toàn so với kiểm duyệt an toàn.
Nguồn tham khảo: Tom's Hardware, The Next Web, CocoLoop, TechRepublic; đã kiểm chứng điều khoản tiết lộ trong chính sách quyền riêng tư và chính sách yêu cầu từ chính phủ của Anthropic, cùng điều khoản tội danh và mức án tối đa theo thông báo của văn phòng cảnh sát trưởng quận Lee.