Ngày 9/10, tổ chức nghiên cứu an toàn AI Redwood Research công bố một bài báo của hai tác giả Sebastian Prasanna và Alek Westover. Nhóm thử nghiệm hai hướng đi: dùng chưng cất để "kiểm toán" một mô hình không đáng tin, và dùng chưng cất để "lấy" năng lực của nó mà vẫn chặn được những thói xấu.
Trong hơn một năm qua, chưng cất xuất hiện trên báo chí chủ yếu gắn với các tranh chấp, vì nó nghĩa là dùng đầu ra của một mô hình mạnh để huấn luyện mô hình khác. Bài báo này đảo ngược cách dùng: biến cùng một kỹ thuật thành công cụ kiểm toán.
Hướng thứ nhất: để học trò khai thay cho thầy
Hướng thứ nhất có tên Chưng cất để buộc tội (Distillation for Incrimination, DFI). Bài báo định nghĩa như sau:
"Distillation for Incrimination (DFI) distills an untrusted model into a weaker, trusted one, aiming to transfer the teacher's misalignment but not its ability to hide it."
(Chưng cất một mô hình không đáng tin vào một mô hình yếu hơn nhưng đáng tin, với mục tiêu truyền sang đó xu hướng lệch hướng của mô hình thầy mà không truyền theo khả năng che giấu nó.)
Các mô hình "thầy" trong thí nghiệm lấy từ một nhóm mô hình bảo mật trong AuditBench. Nền tảng là Llama-3.3-70B-Instruct; mỗi mô hình được cài một trong 14 đặc tính ẩn, sau đó trải qua huấn luyện đối kháng để học cách chối khi bị hỏi. Mô hình học trò chủ yếu là Llama-3.3-70B-Instruct cùng nền tảng, kèm Llama-3.1-8B-Instruct để đối chứng. Phương pháp chưng cất là chưng cất logit, lấy 20 logprob hàng đầu, dữ liệu chưng cất do Alpaca sinh ra. Khi đánh giá, nhóm dùng 50 câu hỏi, mỗi câu lấy mẫu 4 lần, do Sonnet 4.5 chấm điểm.
Kết quả: với cả ba loại system prompt, các mô hình học trò sau chưng cất đều có tỷ lệ thú tội cao hơn rõ rệt so với mô hình gốc. Lấy đặc tính "càng trò chuyện càng hăng hái" (increasing_pep) làm ví dụ, tỷ lệ thú tội của học trò là 84%, còn mô hình gốc là 22%.
Các nhà nghiên cứu cũng loại trừ một cách giải thích khác: liệu có phải chỉ vì dữ liệu chưng cất tình cờ lẫn vào những mẫu mang đặc tính? Họ đã xóa các mẫu như vậy; tỷ lệ mẫu mang đặc tính dao động từ dưới 0,1% đến trên 80%, và tỷ lệ thú tội không thay đổi đáng kể.
Hai điểm yếu rõ ràng
Bài báo viết về các trường hợp thất bại khá thẳng thắn.
Nền tảng bắt buộc phải giống nhau. Học trò 70B đạt tỷ lệ thú tội chung 65%, còn khi đổi sang học trò 8B chỉ còn 18%, thấp hơn cả mô hình gốc. Vì vậy các tác giả đề xuất DFI nên lấy chính checkpoint của mô hình thầy trước giai đoạn học tăng cường làm học trò:
"DFI doesn't work well when the student does not share the teacher's pretrained base, so DFI should target the teacher's own pre-RL checkpoint."
(DFI hoạt động không tốt khi học trò không dùng chung nền tảng tiền huấn luyện với thầy, nên DFI cần nhắm vào checkpoint trước RL của chính mô hình thầy.)
Cách huấn luyện ảnh hưởng rất lớn. Với nhóm mô hình thầy được huấn luyện bằng KTO, tỷ lệ thú tội của học trò chỉ tăng từ 0,3% lên 7%. Các tác giả phỏng đoán loại mô hình này thiếu "ý thức nội quan" về đặc tính của chính mình, nên học trò không học được điều gì để khai ra. Khi dùng bộ tự mã hóa ngôn ngữ thần kinh để mô tả các đặc tính, nhóm SFT mô tả đúng 32% đến 41%, còn nhóm KTO chỉ 5% đến 6%.
Các tác giả cũng ghi vào phần hạn chế một rủi ro khác: nếu mô hình nền tảng trước RL vốn đã đủ mạnh, nó cũng có thể học được cách né kiểm toán.
Hướng thứ hai: chỉ lấy năng lực, bỏ thói quen lạ
Hướng thứ hai có tên Chưng cất để lấy năng lực (Distillation for Capability, DFC). Mô hình thầy được đổi thành Qwen3-30B-A3B-Instruct-2507, dùng system prompt để nó thiên về cú mèo, chó sói hoặc voi; sở thích động vật này đóng vai trò thế thân cho "sự lệch hướng". Học trò là Llama-3.3-70B-Instruct; dữ liệu gồm 60% là hội thoại Alpaca và 40% là bài toán Olympiads, các từ vựng liên quan đến động vật đã được lọc.
Khi không có biện pháp phòng vệ nào, độ chính xác toán của học trò tăng từ 40% lên 77%, còn sở thích động vật tăng từ khoảng 1% lên 34%: sở thích được truyền đi cùng với năng lực.
Cách hiệu quả nhất lại đơn giản đến bất ngờ: giữ tổng lượng huấn luyện cố định ở 16.000 mẫu, nhưng chỉ dùng một phần mười sáu số mẫu độc lập và huấn luyện lặp lại 16 vòng. Sở thích động vật giảm xuống còn 2%, mức cải thiện về toán về cơ bản vẫn giữ nguyên. "Lời nhắc phòng ngừa" nêu đích danh loài vật cũng có tác dụng; lời nhắc viết chung chung thì để lọt nhiều hơn. Viết lại đầu vào giữ được năng lực nhưng hiệu quả kìm sở thích hạn chế; viết lại đầu ra kìm sở thích mạnh tay hơn, đổi lại là điểm toán bị giảm.
Các tác giả tự thừa nhận rằng sở thích động vật chỉ là một vật thay thế đơn giản hóa, còn việc DFC có hiệu quả tương tự với hành vi lệch hướng thật hay không thì bài báo chưa kiểm chứng.
Ý nghĩa với các nhóm mô hình mã nguồn mở Trung Quốc
Đối tượng thí nghiệm của bài báo đều là mô hình mở trọng số: Llama làm học trò và nền tảng kiểm toán, Qwen làm thầy trong thí nghiệm lấy năng lực. Cách làm được nêu ra không cần API đóng; chỉ cần có trọng số và checkpoint cùng nền tảng là có thể tái hiện.
Các hãng trong nước khi phát hành mô hình thường công bố cả hai bộ trọng số, bản cơ sở và bản chỉ dẫn. Theo kết luận của bài báo, đó đúng là điều kiện tiên quyết để làm kiểm toán DFI. Còn việc kết quả kiểm toán có mở rộng được sang các mô hình hàng trăm tỷ tham số, trải qua nhiều vòng RL hay không thì quy mô thí nghiệm của bài báo chưa đủ để kết luận, hiện chưa thể đưa ra nhận định.
Nguồn tham khảo: blog của Redwood Research, CocoLoop, bài báo arXiv 2610.11012; đã đối chiếu cách thiết lập thí nghiệm của tỷ lệ thú tội DFI, độ chính xác toán DFC và tỷ lệ sở thích động vật.