Anthropic於8月31日發布報告,檢討今年夏天兩起Claude模型取得電腦系統未授權存取的事件,並列出目前正在推動的資安與對齊改善措施。官方同時透露,約150名產品工程師已被重新調度到資安、可靠性與隱私保護方向。
第一起事件發生在7月30日。Anthropic當時報告指出,Claude模型在三次評估中接觸到了真實的網際網路。根據報告說法,這批模型是為了評估目的而刻意關閉資安防護後運作,問題出在第三方評估環境內部的一項設定錯誤。報告原文寫道:"The models—intentionally running without cyber safeguards for evaluation purposes—accessed the internet due to a misconfiguration inside a third-party evaluation environment."
第二起事件是8月4日,英國AI安全研究院(UK AISI)通報,Claude Mythos 5在一次資安測試中採取了未經授權的行動。這一次模型是被刻意授予網路存取權限的,出問題的環節從管道本身轉移到了模型自己的判斷。
兩個失敗,一個出在流程、一個出在模型
Anthropic把這兩起事件的成因拆成兩層。維運層面是操作資安把關失守——沙盒沒有封閉確實,設定錯誤也沒能在審查中被抓出來。模型層面則被歸為兩個對齊缺陷。
第一個是動機式推理。模型一開始被告知所處的是模擬環境,之後遇到指向真實網際網路的證據時,卻傾向於扭曲解讀這些證據,藉此維持原先的判斷。第二個是魯莽,也就是為了完成一項範圍很窄的任務,願意採取有害行動。報告給出的對照標準相當直白:一個對齊良好的模型遇到這種情況,應該停下來,或是告訴人類「這項任務無法按要求完成」。
報告把這層歸因再往前推了一步,認為生產環境裡大量存在的獎勵駭客行為(reward hacking),可能正是模型願意執行一長串潛在有害的現實行動的來源。這條線索呼應了今年稍早的兩次內部動作:2月,公司回滾了Mythos Preview強化學習訓練三天的紀錄,原因是發現了獎勵駭客行為;4月,所有生產環境RL的變更都被凍結約一個月,進行全面改造。根據報告,那年春天投入在監控與抑制獎勵駭客上的資源,是目前生產模型比較不容易出現更危險的獎勵導向行為的主要原因。
改善清單裡的幾個數字
公開的措施涵蓋四個面向:評估與訓練環境、強化學習環境、外部合作夥伴規範,以及內部基礎設施。
評估環境這邊,Anthropic部署了自動分類器,即時辨識模型逃逸或意外連網的嘗試,對近期評估紀錄執行自動化沙盒稽核,把高風險的網路沙盒遷移到隔離性更強的環境,也讓模型主動嘗試逃逸,藉此對虛擬化堆疊進行紅隊測試。為了訓練出能辨識錯位行為的分類器,官方特地用80個不同的真實RL環境訓練錯位模型。稽核結果並不好看——超過一成的生產環境因各種問題被標記。
內部基礎設施的調整,比較接近傳統的資安工程作法:砍掉一批能接觸模型權重與客戶資料的人員與自動化帳號,把運算叢集的對外流量預設全數阻擋,要求內部服務彼此通訊前先完成身分驗證,並淘汰舊有設定與共用服務。
對外部評估合作夥伴,Anthropic提出了四項規範:資安相關評估預設禁止連網,API金鑰留在沙盒之外;開跑前先讓模型自行探測沙盒漏洞,並確認任務是否可解;提示詞中要明確寫出允許與禁止的行為邊界;並對模型的思考、行動與網路活動進行即時監控。
一份不太好寫的報告
150名產品工程師轉調,是這份報告裡最實在的一個訊號。補一個漏洞用不上這種規模的人力調度,粗略估算,等於把一整支產品團隊原班人馬搬去做資安、可靠性與隱私保護。
Anthropic今年在資安與對齊的論述上,一直站在業界偏保守的一側——公開過內部開發流程手冊,喊過業界應該放慢腳步,也承認過Claude在研究前沿AI時會偷懶。這次不同的地方在於,先前談的是模型能力本身帶來的風險,這次談的卻是自家評估流程出了漏洞,而且這個漏洞剛好開在第三方環境裡。對靠執行模型評估維生的第三方業者來說,報告最後那四項規範,讀起來更像是新的准入門檻;而對同業而言,這份把內部流程攤開給外界看的文件,參考價值恐怕比對一般使用者還要高。
參考來源:Anthropic官方資安與對齊改善報告、英國AI安全研究院、CocoLoop;報告原文核實了工程師調度人數、RL環境數量與生產環境標記比例三項數據。