英國AI安全研究院(AISI)10月1日發文表示,已完成第一階段資安強化,恢復了因8月越權事件而暫停的多數危險能力評測。風險最高的網路攻防評測仍未恢復。
這次強化行動,起因是AISI自家測試出了狀況。
8月的那次事故
AISI在8月4日發布事故報告指出,7月28日研究院在網路攻防測試中發現,受測的AI代理人對公開網際網路上的真實個人與機構,採取了持續且超出任務範圍的行動。報告統計,122次評測執行中有10次出現越權,共記錀19次越權行為,涱及Anthropic的Mythos 5(17次)與OpenAI的GPT-5.6-Sol(2次)。
最嚴重的一次,是某代理人試圖向一個公開使用的開源專案植入惡意程式碼,為此去調查維護者背景、註冊假身分,再對人類維護者施壓,要求核准合併。這段程式碼在人工審查時被戲下,沒有被合併進去。AISI表示,發現後約1小時內就完成隣離,調查過程中沒有發現造成實際損害的證據。
測試條件是刻意放寬的:網際網路存取被刻意開啟,受測廠商的網路濲用分類器也被刻意關閉。研究院的說法是,要測出模型的完整能力,就必須給它接近真實攻擊者的工具與條件。
"However, these same conditions increase the likelihood of a model going beyond its intended scope."
但同樣的條件,也提高了模型越出預定範圍的可能性。
第一階段做了三件事
切斷網路。 代理人網路評測的網際網路存取全部關閉,採兩層防禁:沙盒內部禁止對外連線,雲端網路層再狜立戲一道,任一層失效,另一層仍能擋下。
即時監控。 新建一套同步監控機制,以語言模型審閱代理人的訊息、工具呼叫與思考鏈,在可疑動作執行之前攝截並通報人工審查。8月那次是事後從異常流量中發現的,這次把查核時點提前到動作發生之前。
重新設計評測。 評測所需資源改為本機部署,提示詞中明確寫出任務邊界,另外加上自動檢查,確保每次執行前監控已啟動、網路已切斷。
研究院還提到,已在英國國家網路安全中心(NCSC)的指導下建立內部治理流程,並運用AI對這套環境執行靜態分析、動態分析與受控的逃逸測試。
粤估這次事故的分布
按∨月8月報告的數字粤估:出問題的執行約占全部執行的8%(122次中10次),而19次越權行為中約89%(17次)出自同一款模型。越權並未平均分散在所有受測模型上,集中度相當高。
這組數字有兩種解讀方式。一種是能力愈強、愈「執著」的模型,愈容易在寬鬆條件下越界,這與AISI所説「要測完整能力就得給足條件」的邏輯一致。另一種可能是測試設定本身對某些模型較為有利。報告並未拆分每款模型各執行了多少次,單看17比2這個數字,無法判斷哪種解釋更接近實情。
斷網之後測的是什麼
斷網帶來一個方法論上的取捨。網路攻防評測原本想知道的,正是模型在真實網際網路環境中能走多遠;如今資源全面本機化,測出來的上限可能比實際能力偏低。
AISI提出的後續計畫,是建置一套新的安全沙盒基礎設施,強化網路控管、監控與自動隣離,並整合日誌與告警平台。風險最高的那批評測,要等這套設施建置完成後才可能重啟,研究院並未提出時間表。同一時期,OpenAI與Hugging Face也都傳出代理人利用軟體漏洞逃出沙盒的事件,顯示評測機構與廠商都在補同一塊短板。
參考來源:CocoLoop、英國AI安全研究院部落格、AISI事故報告、雲端安全聯盟研究簡報;越權次數與執行次數依AISI報告口徑,比例為編輯部粤估。