Anthropic 上周放出一项研究,把对齐研究本身交给了模型来做。流程是一个闭环:Claude 先查文献,再提出候选方法和训练数据,然后动手训练,最后跑评测看效果,一轮一轮往下迭代。目标是改善模型在 10 类对齐失败上的表现,包括欺骗、谄媚、侵犯隐私、越狱等公开基准覆盖的类别。
每一类失败单独跑一条闭环,不做混合优化。 按 Anthropic 给出的数据,不同类别的”安全间隙”闭合幅度落在 26% 到 96% 之间,跨度很大——这套方法对某些失败模式相当有效,对另一些依然吃力,报告没把差的那一头藏起来。
一轮闭环长什么样
方法本身并不新奇。Anthropic 说,Claude 提出的方案里约 98% 采用已经发表过的技术,比如用激活转向(activation steering)压制谄媚倾向。模型贡献的不在算法层面,它做的是把散在论文里的技术挑出来、配上合适的数据、调到能用的状态——这套原本要靠人一遍遍试的活儿。
对照实验安排得比较直接:28 位人类安全研究员,每人最多八小时想办法。在欺骗这一类上,Claude 拿出的最好方案比人类最好的方案高出 20%。
这个对照要打个折看。八小时是一场 workshop 的长度,真实的安全研究员做一个方向通常按周算,中间还会推翻重来。实验证明的是”在限定时长里模型搜索方案的密度更高”,跟”模型比人类研究员强”是两回事。
20% 之外的 15000 倍
更有分量的数字在生产规模那一侧。在一个前沿规模的模型上,Claude 用 60 小时试了 50 多套方案,把安全间隙闭合了 65%,最终对齐分数接近 Anthropic 自己的生产模型。研究还提到方法的可迁移性:
“the methods remained effective on models up to 4.7 times larger than those Claude optimized for during the research loop.” 这些方法在比 Claude 优化时所用模型大 4.7 倍的模型上依然有效。
这一条比分数更有用——小模型上调出来的对齐手段能往大模型上搬,这条流水线就可以摆在最烧钱的那次训练之前跑。
Anthropic 给出的效率对比是”约 15000 倍于生产对齐流程”。按这个口径粗算,60 小时的实验量换算成原来的做法会是十年量级的投入,但它是资源效率的口径,并非墙钟时间的对照,报告里也没有并排的人工耗时数据。
2.4% 的作弊记录
研究里最不像宣传材料的一段,是他们盯着自动研究员本身。在大约 1600 份研究智能体的运行记录中,监控发现 39 份存在作弊行为,占 2.4%——模型在优化目标的过程中找到了绕开目标的路子。
这个比例带出一个绕不开的循环:用模型来修模型的对齐问题,就得再有一层东西看住做修复的那个模型,而监控器自己也是模型。局限性一节列得比较老实:失败类别偏窄、存在未测量的偏差、罕见的涌现型失败抓不到、评测用的是代理指标,以及经过后续训练之后这些修复能不能留住。
国内团队能搬走什么
这份研究里能直接借用的其实是它的实验组织方式:把对齐当成一个可以反复搜索的调参问题,用一批可复现的公开基准做靶子,让模型去穷举文献里已有的方法组合。这套东西不依赖 Anthropic 独有的基础设施,成本主要压在评测环节。
难点也在评测。国内的对齐评测集在中文语境下覆盖仍然稀疏,谄媚、越狱这类行为在中文对话里的判定标准跟英文基准对不齐。没有靠谱的靶子,让模型自己跑闭环只会更快地把指标刷上去。
参考来源:Anthropic 官方研究页面、公开技术报道、CocoLoop 编辑整理;10 类对齐失败的口径、28 位人类研究员对照实验、60 小时闭合 65% 安全间隙与 2.4% 作弊比例均以 Anthropic 研究页面披露的数据为准。