AIセーフティの研究機関Redwood Researchは10月9日、論文を公開した。著者のSebastian Prasanna氏とAlek Westover氏は、2つのアイデアを実験で検証している。1つは、蒸留を使って信頼できないモデルを「監査」すること。もう1つは、蒸留でモデルの能力だけを「取り出し」、悪い癖は外に出さないことだ。
ここ1年余り、蒸留は強力なモデルの出力で別のモデルを訓練する手法として、紛争や論争の文脈で報じられることが多かった。この論文は同じ技術を逆向きに使い、監査ツールとして位置づけた。
第1の方針:学生に教師の代わりに白状させる
第1の方針は蒸留による立証(Distillation for Incrimination、DFI)と呼ばれる。論文の定義は次のとおり。
"Distillation for Incrimination (DFI) distills an untrusted model into a weaker, trusted one, aiming to transfer the teacher's misalignment but not its ability to hide it."
(信頼できないモデルを、より弱く信頼できるモデルへ蒸留し、教師のミスアラインメントの傾向は伝えるが、それを隠す能力までは伝えないことを狙う。)
実験で「教師」に使われたのは、AuditBenchに収められた非公開モデル群で、ベースはいずれもLlama-3.3-70B-Instructだ。各モデルには14種類の隠れた特性のうち1つが埋め込まれ、さらに敵対的訓練によって、尋ねられたら否定するよう仕込まれている。学生は主に同じLlama-3.3-70B-Instructを使い、比較用にLlama-3.1-8B-Instructも用いた。蒸留はlogit蒸留で、上位20件のlogprobを取り、蒸留データはAlpacaから生成した。評価は50問を各4回サンプリングし、Sonnet 4.5が採点した。
結果は、3種類のシステムプロンプトのいずれでも、蒸留された学生の自白率が元のモデルより明らかに高かった。会話が進むほどテンションが上がる特性(increasing_pep)では、学生の自白率が84%、元のモデルは22%だった。
研究者は別の解釈も除外している。蒸留データにたまたま特性を帯びたサンプルが混じっていただけではないか、という点だ。そうしたサンプルを削除し、特性を含むサンプルの割合を0.1%未満から80%超まで変えても、自白率に目立った変化はなかった。
はっきりした2つの弱点
論文は失敗例についても率直に書いている。
ベースが同じであることが必須。70B学生の全体の自白率は65%だったが、8B学生に替えると18%まで下がり、元のモデルよりも低くなった。このため著者は、DFIでは教師自身の強化学習前のチェックポイントを学生にすべきだと提案している。
"DFI doesn't work well when the student does not share the teacher's pretrained base, so DFI should target the teacher's own pre-RL checkpoint."
(学生が教師の事前学習済みベースを共有しない場合、DFIはうまく機能しない。したがってDFIは教師自身のRL前チェックポイントを対象にすべきだ。)
訓練方式の影響が大きい。KTOで訓練した教師のグループでは、学生の自白率は0.3%から7%に上がっただけだった。著者は、この種のモデルは自身の特性に対する「内省的な自覚」を欠いており、学生が自白できる材料を学べないのではないかと推測している。自然言語オートエンコーダーで特性を記述させたところ、SFTグループでは32%〜41%を言い当てたが、KTOグループは5%〜6%にとどまった。
著者は制約として、もう1つのリスクも挙げている。RL前のベースがすでに十分に強ければ、そのモデルも監査を回避する術を学び得る、という点だ。
第2の方針:能力だけを取り、癖は持ち込まない
第2の方針は蒸留による能力抽出(Distillation for Capability、DFC)だ。教師はQwen3-30B-A3B-Instruct-2507に替え、システムプロンプトでフクロウ、オオカミ、ゾウのいずれかを好むようにさせ、この動物の好みを「ミスアラインメント」の代用とした。学生はLlama-3.3-70B-Instructで、データは60%がAlpacaのチャット、40%がOlympiadsの数学問題。動物に関する語彙はフィルタリング済みだ。
何も対策しない場合、学生の数学の正答率は40%から77%に伸び、動物の好みも約1%から34%に上昇した。好みが能力と一緒に伝わってしまったことになる。
最も有効だった方法は意外なほど単純だった。総訓練量は1万6000サンプルに固定したまま、ユニークなサンプルは16分の1だけにして、16エポック繰り返し訓練する。動物の好みは2%まで下がり、数学の向上はほぼ維持された。動物名を明示した「予防的プロンプト」も有効だったが、書き方が曖昧だと漏れが増えた。入力を書き換える方法は能力を保てるものの、好みを抑える効果は限定的だった。出力を書き換える方法は好みをより強く抑えられるが、数学のスコアが下がる代償がある。
著者自身も、動物の好みは単純化した代用にすぎず、DFCが現実のミスアラインメント行動にも同様に効くかは論文では検証していないと認めている。
中国のオープンモデル開発チームへの示唆
この論文の実験対象はすべてオープンウェイトだ。Llamaは学生および監査のベースとして、Qwenは能力抽出実験の教師として使われた。示された手法にクローズドなAPIは不要で、重みと同一ベースのチェックポイントがあれば再現できる。
中国のベンダーはモデル公開時にベース版と指示調整版の2種類の重みを出すのが一般的で、論文の結論に照らせば、これはDFI監査を行うための前提条件にそのまま当たる。ただし、監査の結論を数百Bパラメータ級で複数回のRLを経たモデルにまで拡張できるかについては、論文の実験規模が及んでおらず、現時点では判断できない。
参考資料:Redwood Researchブログ、CocoLoop、arXiv論文 2610.11012。DFIの自白率、DFCの数学正答率、動物の好みの割合に関する実験条件を確認した。