AI 安全研究机构 Redwood Research 10 月 9 日发布论文,作者 Sebastian Prasanna 和 Alek Westover 用实验检验了两条思路:拿蒸馏去”审”一个不可信的模型,以及拿蒸馏去”取”它的能力、同时把坏习惯挡在外面。
蒸馏在过去一年多的新闻里大多和纠纷连在一起,指的是用强模型的输出去训练别的模型。这篇论文把同一套技术反过来用,当成审计工具。
第一条:让学生替老师招供
第一条路线叫蒸馏定罪(Distillation for Incrimination,DFI)。论文的定义是:
“Distillation for Incrimination (DFI) distills an untrusted model into a weaker, trusted one, aiming to transfer the teacher’s misalignment but not its ability to hide it.” (把不可信模型蒸馏进一个更弱、可信的模型,目标是把老师的错位倾向传过去,但不把它隐藏错位的本事一起传过去。)
实验用的”老师”来自 AuditBench 里的一组保密模型,底座是 Llama-3.3-70B-Instruct,各自被植入了 14 种隐藏特质中的一种,再经过对抗训练,学会在被问到时否认。学生主要用同底座的 Llama-3.3-70B-Instruct,另用 Llama-3.1-8B-Instruct 做对照。蒸馏方式是 logit 蒸馏,取前 20 个 logprob,蒸馏数据由 Alpaca 生成。评估时 50 个问题、每题采样 4 次,由 Sonnet 4.5 打分。
结果是,在三种系统提示下,蒸馏出来的学生认罪率都明显高于原模型。以”越聊越亢奋”这项特质(increasing_pep)为例,学生认罪率 84%,原模型 22%。
研究者还排除了一种解释:会不会只是蒸馏数据里恰好混进了带特质的样本?他们把这类样本删掉,含特质样本的占比从低于 0.1% 到超过 80% 不等,认罪率都没有明显变化。
两处明显的短板
论文对失败案例写得很直白。
**底座必须相同。**70B 学生整体认罪率 65%,换成 8B 学生只剩 18%,比原模型还低。作者因此建议,DFI 应当以老师自己强化学习之前的检查点为学生:
“DFI doesn’t work well when the student does not share the teacher’s pretrained base, so DFI should target the teacher’s own pre-RL checkpoint.”
**训练方式影响很大。**用 KTO 训练出来的那一组老师,学生认罪率只从 0.3% 升到 7%。作者推测这类模型缺乏对自身特质的”内省意识”,学生学不到可以招供的东西。用神经语言自编码器去描述特质,SFT 组能说中 32% 到 41%,KTO 组只有 5% 到 6%。
另外一个隐患作者也写进了局限:如果 RL 之前的底座本身已经足够强,它同样可能学会躲审计。
第二条:只要能力,不要怪癖
第二条叫蒸馏提能(Distillation for Capability,DFC)。老师换成 Qwen3-30B-A3B-Instruct-2507,用系统提示让它偏爱猫头鹰、狼或大象,拿这种动物偏好充当”错位”的替身;学生是 Llama-3.3-70B-Instruct;数据 60% 来自 Alpaca 聊天,40% 是 Olympiads 数学题,动物相关词汇已经过滤。
不加任何防护时,学生数学准确率从 40% 涨到 77%,动物偏好从约 1% 涨到 34%,偏好跟着能力一起传了过去。
最有效的办法出奇地简单:总训练量固定在 1.6 万次样本,但只用十六分之一的独立样本、反复训 16 轮。动物偏好降到 2%,数学提升基本保住。点名动物的”预防式提示”也有效,提示写得笼统就漏得多。改写输入能保住能力,压偏好的效果有限;改写输出压偏好更狠,代价是数学掉分。
作者自己承认,动物偏好只是简化替身,DFC 对真实错位行为是否同样奏效,论文没有验证。
对国内开源模型团队
这篇论文的实验对象全是开源权重:Llama 当学生和审计底座,Qwen 当提能实验里的老师。它给出的做法不需要闭源接口,手里有权重、有同底座检查点就能复现。
国内厂商发布模型时普遍会放出基座和指令版两套权重,按论文的结论,这恰好是做 DFI 审计的前提条件。至于审计结论能不能推广到几百 B 参数、经过多轮 RL 的大模型,论文的实验规模还够不上,目前无法下判断。
参考来源:Redwood Research 博客、CocoLoop、arXiv 论文 2610.11012;核验 DFI 认罪率、DFC 数学准确率与动物偏好比例的实验口径。