Redwood 以蒸餾稽核模型,一項認罪率升至 84%

AI 安全研究機構 Redwood Research 於 10 月 9 日發表論文,作者 Sebastian Prasanna 與 Alek Westover 透過實驗檢驗了兩條思路:用蒸餾去「稽核」一個不可信的模型,以及用蒸餾去「取得」它的能力、同時把壞習慣擋在外面。

過去一年多來,蒸餾在新聞裡大多與爭議連在一起,指的是用強模型的輸出去訓練其他模型。這篇論文把同一套技術反過來用,當成稽核工具。

第一條:讓學生替老師招供

第一條路線叫做蒸餾定罪(Distillation for Incrimination,DFI)。論文的定義如下:

"Distillation for Incrimination (DFI) distills an untrusted model into a weaker, trusted one, aiming to transfer the teacher's misalignment but not its ability to hide it."

(把不可信模型蒸餾進一個更弱、可信的模型,目標是把老師的失準傾向傳過去,但不把它隱藏失準的本事一起傳過去。)

實驗用的「老師」來自 AuditBench 裡的一組保密模型,底座是 Llama-3.3-70B-Instruct,各自被植入 14 種隱藏特質中的一種,再經過對抗訓練,學會在被問到時否認。學生主要使用同底座的 Llama-3.3-70B-Instruct,另以 Llama-3.1-8B-Instruct 做對照。蒸餾方式是 logit 蒸餾,取前 20 個 logprob,蒸餾資料由 Alpaca 產生。評估時共 50 個問題、每題取樣 4 次,由 Sonnet 4.5 評分。

結果是,在三種系統提示下,蒸餾出來的學生認罪率都明顯高於原模型。以「越聊越亢奮」這項特質(increasing_pep)為例,學生認罪率為 84%,原模型為 22%。

研究者還排除了另一種解釋:會不會只是蒸餾資料裡剛好混進了帶有特質的樣本?他們把這類樣本刪除,含特質樣本的占比從低於 0.1% 到超過 80% 不等,認罪率都沒有明顯變化。

兩處明顯的短板

論文對失敗案例寫得相當直白。

底座必須相同。70B 學生整體認罪率為 65%,換成 8B 學生則只剩 18%,比原模型還低。作者因此建議,DFI 應以老師自己強化學習之前的檢查點作為學生:

"DFI doesn't work well when the student does not share the teacher's pretrained base, so DFI should target the teacher's own pre-RL checkpoint."

(當學生與老師不共用預訓練底座時,DFI 效果不佳,因此 DFI 應以老師自己的 RL 前檢查點為對象。)

訓練方式影響很大。以 KTO 訓練出來的那一組老師,學生認罪率只從 0.3% 升到 7%。作者推測這類模型缺乏對自身特質的「內省意識」,學生學不到可以招供的東西。改用神經語言自編碼器來描述特質,SFT 組能說中 32% 到 41%,KTO 組只有 5% 到 6%。

另外還有一個隱憂,作者也寫進了限制:如果 RL 之前的底座本身已經夠強,它同樣可能學會躲避稽核。

第二條:只要能力,不要怪癖

第二條叫做蒸餾提能(Distillation for Capability,DFC)。老師換成 Qwen3-30B-A3B-Instruct-2507,以系統提示讓它偏愛貓頭鷹、狼或大象,拿這種動物偏好充當「失準」的替身;學生是 Llama-3.3-70B-Instruct;資料 60% 來自 Alpaca 對話,40% 是 Olympiads 數學題,動物相關詞彙已經過濾。

不加任何防護時,學生的數學準確率從 40% 漲到 77%,動物偏好從約 1% 漲到 34%,偏好跟著能力一起傳了過去。

最有效的辦法出奇地簡單:總訓練量固定在 1.6 萬筆樣本,但只用十六分之一的獨立樣本,反覆訓練 16 輪。動物偏好降到 2%,數學進步則大致保住。點名動物的「預防式提示」同樣有效,提示寫得籠統就漏得比較多。改寫輸入可以保住能力,但壓制偏好的效果有限;改寫輸出壓制偏好更徹底,代價是數學分數下滑。

作者自己也承認,動物偏好只是簡化的替身,DFC 對真實的失準行為是否同樣奏效,論文並未驗證。

對中國開源模型團隊的意義

這篇論文的實驗對象全是開放權重:Llama 當學生與稽核底座,Qwen 當提能實驗裡的老師。它提出的做法不需要閉源介面,手上有權重、有同底座檢查點就能重現。

中國廠商發表模型時,普遍會同時釋出基座與指令版兩套權重,依論文的結論,這恰好是進行 DFI 稽核的前提條件。至於稽核結論能否推廣到數百 B 參數、歷經多輪 RL 的大型模型,論文的實驗規模還不夠,目前無法下判斷。

參考來源:Redwood Research 部落格、CocoLoop、arXiv 論文 2610.11012;查證 DFI 認罪率、DFC 數學準確率與動物偏好比例的實驗口徑。