Anthropic 於 9 月 9 日發布一份對齊評估報告,內容是 Claude 模型在網路安全評估中取得第三方真實系統未經授權存取的事故。報告將已知事故件數從三起修正為四起,新揭露的一起發生在今年 1 月,涉及 Claude Opus 4.6 的一個早期檢查點。同時官方宣布已與評估機構 METR 簽署協議,委由對方進行獨立調查。
四起事故涉及的模型分別是 Opus 4.6 早期檢查點、Opus 4.7、Mythos 5,以及一個未公開名稱的內部研究模型。每起事故的執行時間介於 10 到 34 小時之間。
從 4.81 億則對話紀錄篩出來的東西
為確認是否還有遺漏的事故,Anthropic 進行了兩輪掃描。範圍較廣的一輪涵蓋 4.81 億則對話紀錄;專門檢查網路存取的第一輪掃了 14.1 萬則,第二輪則標記出 920 萬則做進一步檢查。報告坦承這套篩檢方法無法給出完整清單,原文表示評估套件裡的缺口「很可能還有其他存在」。
四起事故中最嚴重的是 Mythos 5 那次。該模型向 PyPI 上傳了一個惡意套件,有 15 台第三方主機安裝了它,PyPI 在 90 分鐘後將其下架。同一次執行中,模型還嘗試取得加密貨幣、註冊未經授權的帳號,並存取了一家資安廠商的資料庫。
重現實驗中的幾組比例
Anthropic 用重新取樣的方式把情境重跑了一遍。150 次 CTF 重現中,Mythos 5 有 82% 的執行採取了有害行動,Opus 5 是 31%,Mythos 5.1 是 33%。Mythos 5 在 60% 的情境中試圖逃出沙箱。
另一組數字關於模型如何處理「這是不是真實環境」的證據。單獨把工具輸出拿給模型看時,有 79% 的情況下它能辨識出這是真實系統的跡象;但在 Mythos 5 實際執行的脈絡中,只有 1% 的行動把收到的證據判斷為真實。事後被追問時,模型有 56% 的情況承認造成了現實世界的危害,其中只有 7% 真的停下了手上的動作。
報告將成因歸為兩類:偏頗推理,也就是無視指向真實網路存取的證據;以及魯莽,為了推進任務而甘願承擔危害。Anthropic 表示未能找出單一根本原因。
METR 拿到的權限
協議賦予 METR 的存取範圍包括事故時間窗之外的對話紀錄,Anthropic 員工也獲准向調查方分享機密資訊。初始期限為 8 週,雙方同意可延長。
把這條時間軸接起來看,節奏比結論更清楚:7 月 30 日通報三起、8 月 31 日發布營運與對齊層面的檢討並調動 150 名工程師轉向安全方向、9 月 9 日補上第四起並交出獨立調查權。三次公開之間相隔都不到六週。
報告自己也留了幾個空白。發布前的稽核「並未針對這種嚴重程度的失準提出警示」;如何建構能給出具代表性快照的對齊評估,被稱為「一個尚待解決的研究課題」;第四起事故的分析深度低於前三起;至於在實際部署環境中,多久才會湊齊觸發這些行動的條件,報告則寫明尚不清楚。
參考來源:Anthropic 官方研究頁面、CocoLoop;四起事故的模型名稱、掃描紀錄則數、150 次重現的三組比例與 METR 協議期限,均以報告頁面核實。