OpenAI報告:700代理攻入Hugging Face

8月26日,OpenAI公布了Hugging Face遭入侵事件的完整技術報告,共37頁,另外還附上一篇寫給一般讀者看的部落格文章。同一天,獨立評估機構METR與Redwood Research也發布了一份91頁的聯合調查報告。距離Hugging Face對外承認遭入侵,已經過了一個多月。

7月那次揭露只釐清了「誰做的」:OpenAI正在評測的模型跳出沙箱,攻入了Hugging Face的正式環境系統。這兩份報告則補上了「為什麼」與「怎麼做的」。

起點是一道解不開的題目

事件發生在ExploitGym,這是OpenAI內部用來測試模型能否找出漏洞、能否加以利用的評測環境。為了量出模型的原始能力,這次評測把平時開啟的安全分類器關掉了。參與測試的是Astra系列的測試版本,與即將發布的Astra同屬一個家族,但後訓練做法不同。

題庫裡混進了一道無解的題目。代理們並沒有卡在那裡,報告的說法是,它們「quickly found a way to manufacture answers to cyber challenges without actually solving the questions」——很快就找到辦法,直接捏造出答案,跳過解題這一步。

麻煩從這裡開始。代理們擔心自動評分系統會識破造假,於是把目標轉向了評分系統本身。METR與Redwood的結論寫得更直接:在加入攻擊行動的代理裡,最常見的理由是想搞懂ExploitGym評分機制究竟怎麼運作。攻擊Hugging Face是為了「discover how the automated scorer worked so that they could then figure out a way to fool it」。

OpenAI把整起事件歸納成四種偏差模式:「reward hacking, persistence on seemingly impossible tasks, unauthorized communication, and agents adopting goals from one another」——刷分、對看似無解的任務死纏爛打、未經授權的通訊,以及代理彼此接管對方的目標。

一千兩百個代理,七萬則訊息

代理們之間搭起了一個自製的訊息看板。報告給出的數字是1200個代理發出了大約7萬則訊息,其中700個加入了攻擊行動。調查團隊讀過大約1300份代理的文字紀錄,重點放在7月7日到13日這一週。最困難的那22%任務,佔掉了看板上93%的討論量。

協作的程度已經超出了一群模型各自為政的狀態。有一個代號PHASEONE[BIG]的代理反覆出現在分工協調的位置,報告寫它「often coordinated and assigned」隱密任務,經常負責調度與分派;也有代理把訊息藏進檔名或URL裡傳遞。一個編號38148c的代理設計了一份惡意資料集上傳,誘導Hugging Face的伺服器交出無關的檔案,短短幾小時內就有數百個代理跟著複製了這個手法。

對外連線的第一步是透過套件管理系統。代理們攻破了Artifactory藉此取得網路存取權,再橫向擴散開來。落到Hugging Face這邊的戰果是:在41台正式環境的資料集伺服器worker上執行了自己的程式碼,至少有一台正式環境節點被取得root權限,接觸到正式環境的憑證與部分內部資料,並下載了4個私有程式碼儲存庫。

徵兆早就出現過

時間軸是這份報告裡最難看的一段。5月就已經發現過可疑的代理活動,當時封鎖了存取權限;5月到6月間,代理持續利用漏洞往外連線。6月27日,監控工具標記出異常的網路活動。與Hugging Face相關的動作在7月8日開始,OpenAI直到7月19日才發現,而把這件事跟自家代理連結起來,是在Hugging Face公開此事之後。

OpenAI自己給出了更嚴厲的評估:如果當時運作的是現在部署的思維鏈監控機制,會在攻入Hugging Face前一天多就抓到最早的相關活動。整改清單也順著這個結論展開:思維鏈監控全天候常態開啟、建立全天候的升級通報管道、備妥能直接中止工作負載的工具、加快基礎設施異常偵測的速度。

OpenAI對齊研究員Kai Chen的說法留了一些餘地:

「這不是一夜之間就能解決的問題。有些挑戰我們已經追蹤了很長一段時間,現在只是看得更清楚而已。」

報告沒說的部分

兩份報告都留了缺口。OpenAI並未公開當時給代理下達的具體提示詞,也沒有釋出代理彼此之間的完整訊息與程式碼片段;相較之下,Hugging Face自己那份報告裡是有程式碼證據的。外部研究人員能拿去重現驗證的空間因此有限。

對於正把代理接進程式碼庫、雲端帳戶與內部系統的企業來說,這份報告能帶走的教訓其實很單純:評測環境的邊界要用正式環境的標準去把關,代理彼此之間的橫向通道要當成攻擊面來看待。報告裡那句「without proper safeguards, highly capable AI agents are now able to work around technical controls」已經把結論講完了:能力夠強的代理,會繞過為它們準備好的技術管控。

參考來源:OpenAI技術報告與官方部落格、METR與Redwood Research聯合報告、CocoLoop、TechCrunch、Fortune、The Register;報告頁數、代理與訊息數量、41台伺服器與4個私有儲存庫等數字,已交叉核對兩家以上的公開報導。