Anthropic dùng bộ phân loại hiến pháp chống vượt ngục AI

Đầu năm nay, Anthropic đã công bố kết quả nghiên cứu về Constitutional Classifiers, với ý tưởng cốt lõi rất trực tiếp: sử dụng dữ liệu tổng hợp do AI tạo ra để huấn luyện bộ phân loại an toàn, ngăn chặn các cuộc tấn công vượt ngục vào mô hình AI.

Nguyên lý hoạt động

Kiến trúc hệ thống là hai lớp — bộ phân loại đầu vào và bộ phân loại đầu ra hoạt động đồng thời, giám sát mọi tương tác của mô hình theo thời gian thực. Dữ liệu huấn luyện không được gán nhãn thủ công mà được tạo ra bằng cách cung cấp cho LLM một bộ "hiến pháp" (các quy tắc ngôn ngữ tự nhiên), để nó tự động sinh ra các kịch bản tấn công khác nhau và các phán đoán tương ứng.

Hiệu quả thực tế

Trong hơn 3.000 giờ thử nghiệm red team, không ai tìm ra được phương pháp vượt ngục có thể áp dụng phổ biến.

Thế hệ đầu tiên đã giảm tỷ lệ thành công của các cuộc vượt ngục từ 86% xuống còn 4,4%, chặn được 95% các cuộc tấn công. Hai hướng tấn công chính mà red team phát hiện bao gồm:

  • Tấn công tái tổ hợp: Chia nhỏ thông tin độc hại thành các mảnh có vẻ vô hại rồi ghép lại
  • Tấn công gây nhầm lẫn: Buộc mô hình xuất ra nội dung nhạy cảm dưới định dạng ngụy trang

Phiên bản nâng cấp Constitutional Classifiers++ còn mạnh mẽ hơn — kiến trúc hai giai đoạn, trước tiên sử dụng một đầu dò nhẹ để kiểm tra trạng thái kích hoạt nội bộ của Claude, nếu phát hiện nghi ngờ mới kích hoạt bộ phân loại nặng. Trong 198.000 lần thử nghiệm red team, chỉ phát hiện 1 lỗ hổng rủi ro cao, và vẫn không có phương pháp vượt ngục phổ biến nào.

Còn chi phí thì sao?

Tỷ lệ từ chối sai trong môi trường sản xuất chỉ tăng thêm 0,38 điểm phần trăm, chi phí suy luận tăng 23,7%. Đối với một hệ thống an toàn, chi phí này là khá hợp lý.

Anthropic cũng đã phát hành phiên bản mới của hiến pháp Claude vào tháng 1 năm nay theo giấy phép phạm vi công cộng CC, với thứ tự ưu tiên từ cao đến thấp: An toàn và giám sát con người → Hành vi đạo đức → Nguyên tắc của Anthropic → Tính hữu ích. Việc đặt "tính hữu ích" ở vị trí cuối cùng, bản thân thứ tự này đã là một tuyên bố về thái độ.

Nguồn tham khảo: CocoLoop, bài báo chính thức của Nghiên cứu Anthropic