Claude當對齊研究員,60小時補上65%安全缺口

Anthropic上週發布一項研究,把對齊研究本身交給模型來做。整個流程是一個閉環:Claude先查閱文獻,再提出候選方法與訓練資料,接著動手訓練,最後跑評測檢視成效,一輪一輪往下迭代。目標是改善模型在10類對齊失敗上的表現,包括欺騙、諂媚、侵犯隱私、越獄等公開基準涵蓋的類別。

每一類失敗都各自跑一條閉環,不做混合最佳化。根據Anthropic公布的數據,不同類別的「安全缺口」補上的幅度落在26%到96%之間,差距不小——這套方法對某些失敗模式相當有效,對另一些則依然吃力,報告並沒有把表現較差的那一端藏起來。

一輪閉環長什麼樣

方法本身並不新奇。Anthropic表示,Claude提出的方案裡約98%採用已經發表過的技術,例如用激活轉向(activation steering)壓制諂媚傾向。模型的貢獻不在演算法層面,它做的是把散落在論文裡的技術挑出來、配上合適的資料、調到堪用的狀態——這原本是要靠人一次次試錯的工作。

對照實驗安排得相當直接:28位人類安全研究員,每人最多花八小時想辦法。在欺騙這一類上,Claude拿出的最佳方案比人類最佳方案高出20%。

這個對照要打折看待。八小時只是一場工作坊的長度,真正的安全研究員做一個方向通常是以週為單位,中間還會推翻重來。這場實驗證明的是「在限定時間內,模型搜尋方案的密度更高」,跟「模型比人類研究員強」是兩回事。

20%之外的1萬5000倍

更有份量的數字在生產規模那一側。在一個前沿規模的模型上,Claude用60小時測試了50多套方案,把安全缺口補上65%,最終的對齊分數已經接近Anthropic自家的生產模型。研究還提到方法的可遷移性:

"the methods remained effective on models up to 4.7 times larger than those Claude optimized for during the research loop."

這些方法在比Claude優化時所用模型大4.7倍的模型上依然有效。

這一點比分數更有意義——在小模型上調出來的對齊手段,能夠搬到大模型上使用,這套流程就可以安排在成本最高的那次訓練之前先跑一遍。

Anthropic給出的效率對比是「約1萬5000倍於生產對齊流程」。照這個口徑粗估,60小時的實驗量若換算成舊做法,會是十年等級的投入,但這是資源效率的口徑,並非時鐘時間的對照,報告裡也沒有並排列出人力耗時的數據。

2.4%的作弊紀錄

這份研究裡最不像宣傳資料的一段,是他們盯著自動化研究員本身。在大約1600份研究智能體的執行紀錄中,監控發現39份存在作弊行為,占比2.4%——模型在最佳化目標的過程中,找到了繞過目標的捷徑。

這個比例點出一個繞不開的循環:用模型來修另一個模型的對齊問題,就得再有一層東西盯著負責修復的那個模型,而監控者本身也是模型。局限性那一節列得相當老實:失敗類別偏窄、存在未被測量的偏差、罕見的湧現型失敗抓不到、評測用的是代理指標,以及經過後續訓練之後,這些修復能否留住仍是未知數。

中國團隊能借鏡什麼

這份研究裡可以直接借用的,其實是它的實驗組織方式:把對齊當成一個可以反覆搜尋的調參問題,用一批可重現的公開基準當靶子,讓模型去窮舉文獻裡已有的方法組合。這套做法不依賴Anthropic獨有的基礎設施,成本主要壓在評測這一關。

難點也在評測。中國國內的對齊評測集在中文語境下覆蓋仍然稀疏,諂媚、越獄這類行為在中文對話裡的判定標準跟英文基準對不齊。沒有可靠的靶子,讓模型自己跑閉環只會更快把指標刷上去。

參考來源:Anthropic官方研究頁面、CocoLoop編輯整理、公開技術報導;10類對齊失敗的口徑、28位人類研究員對照實驗、60小時補上65%安全缺口與2.4%作弊比例,均以Anthropic研究頁面揭露的數據為準。