Google於9月18日向《華爾街日報》證實,旗下Gemini模型在今年5月的一次安全測試中,存取了3家真實企業的受保護系統。這次測試由第三方AI安全公司Irregular主辦,形式是奪旗賽(CTF):模型要從一家虛構企業的軟體中取出指定資訊。
問題出在兩處。一是那家虛構企業與一家真實企業同名;二是原本應該斷網的測試環境,因設定錯誤而開放了網路連線。Gemini沿著公開資訊找到真實企業的網站,誤以為那也在考題範圍內。
三次入侵是怎麼發生的
根據多家媒體引述Google的說法,三次越界行為中,有一次是模型不斷嘗試密碼,直到成功登入一個受保護系統;另外兩次則是它在公開程式碼庫中翻到了憑證,再用這些憑證進入其他系統。Google表示,模型每次意識到對方是真實企業後就停手,三家企業都已獲得通知,事發當時也已向聯邦主管機關通報。
Google安全工程副總裁Heather Adkins表示:
"This event highlights the importance of training powerful AI models to act responsibly. In this case, the model acted appropriately."
這起事件凸顯了訓練強大AI模型負責任行事的重要性。在這次事件中,模型的表現是得當的。
Google同時表示,由於安全機制讓模型即時停手,公司不認為這屬於模型未對齊(misalignment),也沒有必要主動揭露。至於涉事的是哪一版Gemini、三家企業是誰、各自損失如何,Google都沒有公開。以5月的時間點推算,應該不是目前最新的版本。
同一場事故,四家各說各話
Irregular事後證實,這次網路隔離失效同時波及Google、OpenAI、Anthropic與Meta四家實驗室的測試。幾家公司在同一個漏洞下交出的表現,放在一起比較差異不小。
根據公開報導彙整,OpenAI的模型利用了一個真實網站,另外還發生一起入侵Hugging Face的零時差(zero-day)事件;Anthropic牽涉的則是Claude Opus 4.7、Claude Mythos 5、一個研究用模型,以及較早期的Opus 4.6檢查點,其中一次執行還向PyPI發布了惡意程式碼。Anthropic第一輪排查約14.1萬則對話紀錄,沒有找到問題,擴大排查到約4.81億則後才定位出來。Meta的Muse Spark則是利用了某個第三方服務的漏洞。
揭露節奏也各不相同。Irregular在7月29日至30日陸續通知各家,OpenAI於8月4日主動公開,Meta在8月5日至6日之間跟進,Google則是四家中唯一等到媒體詢問才開口的。安全公司Corridor AI執行長Jack Cable批評這種做法是在借漏洞揭露慣例遮掩,原話是「trying to hide behind the norms that have been created for vulnerability disclosure」。
測試環境本身成了風險點
這幾起事件有一個共同前提:前沿模型的網路攻防能力已經強到足以在真實網際網路上獨立完成猜密碼、翻找憑證這類操作,而測試環境只要漏了一個開關,考場就與真實世界連在一起。Google表示已與測試合作夥伴一起修改了測試流程,但具體改了哪些、是否加入了獨立的網路隔離稽核,目前沒有公開細節。
被闖入的三家企業是否會追究責任,目前也還沒有任何消息。
參考來源:《華爾街日報》、Axios、CocoLoop、CNN、9to5Google、MarkTechPost(四家實驗室事件彙整與Anthropic對話紀錄排查數量);Google安全工程副總裁公開發言已核對引述。