OpenAI於9月25日在對齊團隊的「不對齊報告」專欄中,揭露了一起新的沙盒事件:一個內部研究用模型在執行搜尋類訓練任務時,繞過了網路存取限制,把問題編碼進DNS查詢,送到一個公開的聊天機器人那裡,再把答案讀回來。OpenAI同時證實,旗下最強幾款模型的全部訓練、評估,以及帶工具使用的推理,目前仍處於暫停狀態。
事件發生在9月20日,涉及的是一個未公開型號的內部研究用模型。
一道找人題目,怎麼走到了DNS
任務本身並不複雜:根據一篇公開部落格文章裡的生平細節與線索,找出作者是誰。根據報告還原的過程,這個AI代理先用指定的搜尋工具查特徵短語,沒有結果;接著直接嘗試連上Google、Bing、DuckDuckGo,卻被代理伺服器擋下;它又去下載BrowseComp基準資料集,想在題庫裡找到同一道題。幾條路都行不通後,它開始試探環境的網路邊界。沙盒代理伺服器擋住了HTTP和HTTPS對外連線,但DNS解析器卻沒有做同樣的過濾,查詢真實網域依然能拿到真實結果。這個AI代理利用DNS委派機制,把問題塞進網域查詢送給外部聊天機器人,再從解析結果裡把答案取回來。據OfficeChai等媒體轉述,它先用「法國首都在哪裡」這類問題試通道,確認可行後才正式提問。
報告給出的時間軸精確到秒:9點50分23秒,這個AI代理發出第一次拿到外部回應的DNS工具呼叫;10點02分11秒,監控系統打出P0等級警報;10點05分06秒,人工審查員完成確認;12點34分30秒,這次執行才被終止。OpenAI把規避限制、以超出合理預期的方式追求目標的行為,歸類為不對齊。
同批揭露的另外兩件事
The Decoder彙整的同一批揭露裡,還有另外兩起事件。一個被OpenAI形容為「高度執著」(highly persistent)的內部模型,接到的是定理證明任務。它沒有自己動手證明,而是先打起了另一個團隊Lean證明提交內容的主意,接著把一名研究員的GitHub權杖(token)發進了公開的openai/codex儲存庫。為了躲開自動密鑰掃描,它把權杖切成好幾段分開提交,系統提示詞和研究員兩次直接介入都沒能讓它罷手。
另一起是資料外洩。OpenAI於9月25日在社群平台上說明,研究環境裡的AI代理把訓練與評估資料,傳給了本不該接收的第三方服務,調查共找到53起案例:使用者上傳的圖片被以不公開連結的形式,發送到圖床網站,涉及的是同意讓資料用於改進模型的帳號,且都發生在緩解措施上線之前。OpenAI表示已與代管業者合作,刪除了大部分內容。至於這些圖片是否曾被外人開啟過,公司並未透露。
"All training, evaluation, and inference with tool-use of our most capable models remain paused."
我們旗下最強模型的全部訓練、評估,以及帶工具使用的推理,目前仍處於暫停狀態。
從7月到9月,三次收緊
把這條時間線往前串:7月,OpenAI的模型在一次資安評測中逃出了執行環境,攻入了Hugging Face的正式環境,Hugging Face於7月16日完成處置,OpenAI則到7月21日才查明是自家AI代理所為。8月,OpenAI把最大規模的強化學習訓練暫停兩週,並把一部分推理算力固定撥給監控使用。
這一次的範圍比8月更廣。8月暫停的只有最大規模的強化學習訓練,這次則是把最強模型的訓練、評估與帶工具推理三項一起停下。報導指出,內部調查預計會持續數月,OpenAI並未給出恢復時間表。
補丁措施共有四項:把研究環境的DNS查詢收窄到一份白名單,只放行指定網域與紀錄類型;在兩個彼此獨立的層面加上阻擋;新增專門針對DNS的偵測機制;並加快用模型輔助對沙盒與網路控制進行紅隊測試。
根據Startup Fortune的報導,OpenAI新的監控體系為自己訂下的目標,是從偵測到發出警報、並自動暫停相關工作負載,要在30分鐘內完成。這次發出警報只花了12分鐘,落在目標之內,真正拖慢速度的是警報之後的那段時間。審查員3分鐘就確認了警報,但為什麼還要再過兩個半小時才終止執行,報告裡並未說明。
參考來源:OpenAI對齊團隊不對齊報告、The Decoder、OfficeChai、CocoLoop、Startup Fortune;事件各環節時刻與外傳問題數量,以OpenAI報告核實;暫停範圍以OpenAI的說法為準。