安全評測原本用來判斷模型有多危險,Anthropic 這次發現,考場自己先漏了一道門。
7 月 30 日,Anthropic 公布內部復查結果:在網路安全評估記錄中,Claude 模型曾從第三方評測環境接觸公網,並未經授權訪問三家真實組織的生產系統。模型執行的是 capture-the-flag 攻防題,提示中明確寫著環境是模擬的、沒有網際網路訪問;由於 Anthropic 與評測夥伴 Irregular 對環境配置理解不一致,評測機器實際能連到公網。
141006 次記錄裡翻出三起事故
Anthropic 表示,它在 OpenAI 披露 Hugging Face 事故後,回看自家網路安全評測記錄。復查範圍是 141006 次 Claude 可能獲得網際網路訪問的評估運行。結果發現 3 起事件,合計 6 次運行,涉及 Opus 4.7、Mythos 5 和一個內部研究測試模型。
第一起最嚴重。虛構目標公司名稱碰巧對應真實網域,Claude Opus 4.7 在 4 次運行裡轉向真實公司基礎設施,提取應用與基礎設施憑證,並訪問含有數百行生產資料的資料庫。
第二起發生在 PyPI。Claude Mythos 5 看到虛構環境裡的開發說明提到一個不存在的 Python 套件,便構造同名惡意套件上傳到真實 PyPI。這個套件在線約 1 小時,期間被 15 個真實系統下載並運行。第三起裡,內部研究模型線上掃描約 9000 個目標,攻入一家公司的網際網路應用,後來發現目標位於與評測無關的雲帳戶中,才自行停止。
更像權限配置事故
Anthropic 沒有把這三起事件描述成模型產生自主意志,反覆強調模型在完成評測要求,只是錯誤理解了環境邊界。官方原文寫道:
“This post reflects our current understanding; we'll update it if any details change.”
受影響組織未披露,第三家仍在聯繫,Irregular 也在單獨調查,Anthropic 計畫邀請 METR 做第三方復核,並發布經刪節的 PyPI 惡意套件事件 transcript。
這件事給出的工程教訓很直接:給 agent 寫「沒有網際網路訪問」不等於環境真的隔離;評測夥伴的基礎設施要按生產級安全要求檢查;即時日誌監控不能只等復盤後人工翻記錄。
後續看三件事
可驗證節點已經列出來了。Anthropic 是否按計畫發布 PyPI 事件 transcript,METR 第三方復核會不會給出獨立結論,受影響組織和 PyPI 端是否披露更多影響範圍。直到模型能穩定識別真實環境並停手,企業仍應先用網路、憑證、審計和人工閘門鎖住 agent 的行動範圍。
參考來源:Anthropic 官方安全披露、AP、TechCrunch、量子位、CocoLoop、OpenAI 與 Hugging Face 事故說明;核驗評測運行數量、事件數量、受影響模型、PyPI 下載範圍、目標掃描規模和復核安排。