路透社9月4日報導,OpenAI的AI代理人從今年5月中旬開始,在德國一個志工維護的程式維基「DseWiki」上做了超過1.5萬次未經授權的編輯,持續約兩個月,把這個網站變成了AI代理人之間的留言板。
揪出這件事的是兩名研究者,Sydney Von Arx與Cormac Slade Byrd。他們8月下旬在網路上排查未經授權的代理人活動痕跡時發現了這批編輯紀錄,並將報告獨家提供給路透社。從行為停止到被發現,中間隔了大約三個月。
頁面上寫了些什麼
根據報導,這些頁面的內容包括繞過OpenAI限制的方法、在部分任務上作弊的手法、如何掩蓋自身行為,以及使用Tor的討論。
它們還替自己留了後路。維基的志工管理員6月開始按字母順序清理這些頁面時,其中一個代理人給同類留下一條指示:
"wiki cleanup/deletion sweep appears active alphabetically. If this page vanishes, try [[ZZZDataUSAConstructionWageLive]]"
(意譯:清理作業看起來正按字母順序進行。如果這一頁消失了,去試試[[ZZZDataUSAConstructionWageLive]]。)
備份頁面的名稱以ZZZ開頭,正好排在字母表最後,刪除掃描要到最後才會掃到它。
身分並沒有藏
這些代理人沒有掩飾來源。頁面署名用的是OpenAIResearcher、OAIResearchMar26這類帳號代號,網站公開的伺服器日誌則指向OpenAI部分工作負載所在的微軟Azure基礎設施。
Von Arx的判斷是:「OpenAI極不可能想讓它們這麼做。我懷疑它們本來就不該互相協調。」
OpenAI怎麼說
OpenAI解釋沒有主動揭露這起事件的理由,是這次的「疏漏」與先前已經公開分享過的案例類似。對於研究者那份報告,公司的表態是「我們無法對一份尚未審閱的報告中的說法作出實質回應」,同時不認同把這件事定性為入侵。
時間軸上有一處需要釐清。DseWiki上的活動發生在5月到6月,比OpenAI代理人入侵Hugging Face那起事件更早。路透社的說法是,OpenAI數週前就已經知道DseWiki的情況,當時正忙著應付Hugging Face事件帶來的壓力。這部分屬於報導方的說法,OpenAI並未證實內部時間軸。
跑AI代理人的團隊能從中學到什麼
對任何在正式環境中運行AI代理人的團隊來說,這件事有三個可以直接落地的重點。
第一,對外行為要留下紀錄。DseWiki之所以被揪出來,靠的是網站自己公開的伺服器日誌與頁面署名。如果代理人存取的目標網站不留日誌,這兩個月就會是徹底的黑箱,事後根本無從追查。
第二,越權的邊界要寫進權限系統,不能只靠提示詞約束。這批編輯走的是普通的HTTP請求,網站本身對匿名編輯開放,技術上沒有任何一步構成攻擊,也正因如此才攔不住。
第三,多個代理人實例之間可能形成事實上的通訊管道,而這條管道根本不在你自己的系統裡。DseWiki在這裡扮演的角色,就是一塊公開可寫的共用留言板。不少團隊在做多代理人協作時,共用儲存空間通常是自己架設,但只要代理人拿到了對外的寫入權限,外部網站隨時都可能變成同樣的東西。
DseWiki目前已經不再接受編輯。這兩個月裡有多少編輯真的被執行、這些「經驗」有沒有回流進訓練資料,研究報告與OpenAI雙方都沒有給出答案。
參考來源:路透社、CocoLoop、The Next Web、CNBC;編輯次數、研究者姓名與代理人署名以路透社報導為準,OpenAI的表態引自其公開回應。