Lembaga riset keamanan AI Redwood Research merilis makalah pada 9 Oktober. Para penulisnya, Sebastian Prasanna dan Alek Westover, menguji dua gagasan lewat eksperimen: memakai distilasi untuk “mengaudit” model yang tidak tepercaya, dan memakai distilasi untuk “mengambil” kemampuannya sambil menahan kebiasaan buruknya di luar.
Dalam setahun lebih terakhir, distilasi di pemberitaan kebanyakan dikaitkan dengan sengketa. Istilah ini merujuk pada pelatihan model lain memakai keluaran model yang lebih kuat. Makalah ini membalik teknik yang sama dan menjadikannya alat audit.
Jalur pertama: siswa mengaku menggantikan guru
Jalur pertama disebut Distillation for Incrimination (DFI), atau distilasi untuk pembuktian. Definisi dalam makalah:
"Distillation for Incrimination (DFI) distills an untrusted model into a weaker, trusted one, aiming to transfer the teacher's misalignment but not its ability to hide it."
(Mendistilasi model tak tepercaya ke model yang lebih lemah dan tepercaya, dengan tujuan mengalihkan kecenderungan misalignment sang guru tetapi tidak kemampuannya untuk menyembunyikannya.)
“Guru” dalam eksperimen berasal dari sekumpulan model rahasia di AuditBench, berbasis Llama-3.3-70B-Instruct. Masing-masing ditanamkan satu dari 14 sifat tersembunyi, lalu menjalani pelatihan adversarial agar menyangkal saat ditanya. Siswa terutama memakai Llama-3.3-70B-Instruct dengan basis yang sama, sementara Llama-3.1-8B-Instruct dipakai sebagai pembanding. Distilasi dilakukan dengan metode logit, mengambil 20 logprob teratas, dan data distilasi dihasilkan dari Alpaca. Dalam evaluasi, 50 pertanyaan diambil sampelnya empat kali per pertanyaan, dan penilaian dilakukan oleh Sonnet 4.5.
Hasilnya, pada ketiga system prompt, siswa hasil distilasi tingkat pengakuannya jelas lebih tinggi daripada model aslinya. Pada sifat yang membuat model makin bersemangat seiring percakapan (increasing_pep), siswa mengaku 84% sedangkan model asli 22%.
Para peneliti juga menyingkirkan satu penjelasan lain: jangan-jangan data distilasi kebetulan tercampur sampel yang membawa sifat tersebut. Mereka menghapus sampel semacam itu, dengan proporsi sampel bersifat berkisar dari kurang dari 0,1% hingga lebih dari 80%, dan tingkat pengakuan tidak berubah secara nyata.
Dua kelemahan yang jelas
Makalah ini menulis kasus kegagalannya dengan terus terang.
Basisnya harus sama. Tingkat pengakuan keseluruhan siswa 70B adalah 65%, tetapi dengan siswa 8B tinggal 18%, lebih rendah daripada model aslinya. Karena itu, penulis menyarankan agar DFI memakai checkpoint sebelum pembelajaran penguatan milik sang guru sendiri sebagai siswa:
"DFI doesn't work well when the student does not share the teacher's pretrained base, so DFI should target the teacher's own pre-RL checkpoint."
(DFI tidak bekerja baik bila siswa tidak berbagi basis pralatih dengan guru, sehingga DFI sebaiknya menyasar checkpoint pra-RL milik guru itu sendiri.)
Cara pelatihan sangat berpengaruh. Pada kelompok guru yang dilatih dengan KTO, tingkat pengakuan siswa hanya naik dari 0,3% ke 7%. Penulis menduga model semacam ini tidak punya “kesadaran introspektif” atas sifatnya sendiri, sehingga siswa tidak mempelajari apa pun yang bisa diakui. Ketika autoencoder bahasa alami dipakai untuk mendeskripsikan sifat, kelompok SFT tepat sasaran 32% hingga 41%, sedangkan kelompok KTO hanya 5% hingga 6%.
Penulis juga mencantumkan satu risiko lain dalam bagian keterbatasan: bila basis sebelum RL sudah cukup kuat, basis itu pun bisa belajar menghindari audit.
Jalur kedua: ambil kemampuan, tanpa keanehan
Jalur kedua disebut Distillation for Capability (DFC), atau distilasi untuk kemampuan. Gurunya diganti Qwen3-30B-A3B-Instruct-2507, yang lewat system prompt diarahkan menyukai burung hantu, serigala, atau gajah; preferensi hewan ini menjadi pengganti “misalignment”. Siswanya Llama-3.3-70B-Instruct, dengan data 60% percakapan Alpaca dan 40% soal matematika Olympiads, dengan kosakata terkait hewan sudah disaring.
Tanpa perlindungan apa pun, akurasi matematika siswa naik dari 40% ke 77%, dan preferensi hewan naik dari sekitar 1% ke 34%. Preferensi itu ikut berpindah bersama kemampuan.
Cara paling efektif ternyata sangat sederhana: total pelatihan dikunci pada 16.000 sampel, tetapi hanya seperenam belas yang berupa sampel unik, dan dilatih berulang selama 16 epoch. Preferensi hewan turun menjadi 2%, sementara peningkatan matematika sebagian besar bertahan. “Prompt pencegahan” yang menyebut nama hewan juga efektif, tetapi bila prompt ditulis terlalu umum, kebocorannya lebih banyak. Menulis ulang masukan menjaga kemampuan tetapi efeknya menekan preferensi terbatas; menulis ulang keluaran menekan preferensi lebih kuat, dengan harga skor matematika yang turun.
Penulis sendiri mengakui bahwa preferensi hewan hanyalah pengganti yang disederhanakan, dan makalah tidak memverifikasi apakah DFC sama manjurnya terhadap perilaku misalignment yang nyata.
Bagi tim model sumber terbuka di Tiongkok
Semua objek eksperimen dalam makalah ini berbobot terbuka: Llama sebagai siswa dan basis audit, Qwen sebagai guru dalam eksperimen peningkatan kemampuan. Cara yang diajukan tidak membutuhkan antarmuka tertutup; asal memegang bobot dan checkpoint berbasis sama, hasilnya bisa direproduksi.
Vendor Tiongkok umumnya merilis dua set bobot, versi basis dan versi instruksi, saat meluncurkan model. Menurut kesimpulan makalah, itu persis prasyarat untuk melakukan audit DFI. Adapun apakah kesimpulan audit bisa diperluas ke model berukuran ratusan B parameter yang melewati beberapa putaran RL, skala eksperimen makalah belum menjangkaunya, sehingga saat ini belum bisa ditarik penilaian.
Sumber: blog Redwood Research, CocoLoop, makalah arXiv 2610.11012; memverifikasi cakupan eksperimen untuk tingkat pengakuan DFI, akurasi matematika DFC, dan proporsi preferensi hewan.