Astra漏洞測試滿分 OpenAI收緊發布

OpenAI在9月1日發布一份題為《Path to Astra》的文件,把尚未正式上市的新模型Astra列入自家Preparedness框架的最高風險等級:網路安全能力達到Critical。這套框架運作三年來,這是OpenAI第一次為自家模型貼上這個標籤。

支撐這項判斷的是一套內部基準測試ExploitBench。OpenAI放進20個高風險漏洞,Astra全數過關。更引人注目的是,在經過改造的測試環境中,Astra自行找出並利用了兩個先前無人知曉的零時差漏洞,還把它們串成一條完整的攻擊鏈。

Critical這條線畫在哪

Preparedness框架於2023年推出,去年一次更新把能力區分為兩個等級。「High」指模型能放大既有的致害途徑,「Critical」指模型能開創前所未有的新途徑。落到網路安全這一項,要跨過Critical必須符合其中一項:不需要人類一步步引導,就能在多個經過強化的真實關鍵系統中,識別並寫出涵蓋各種嚴重程度、可實際使用的零時差漏洞攻擊;或者只給一個高層次目標,就能自主設計並執行針對強化目標的全新端到端攻擊。

這兩道門檻都不算低。Astra被判定跨過去,代表OpenAI內部評估認為它已經不再需要人類當拐杖。

發布怎麼安排

文件裡的原話是:

We plan to make Astra available soon, but access to its most advanced cybersecurity capabilities will be more limited.

具體安排分成兩階段。第一階段,最強的網路安全能力只開放給一小批Alpha測試者;第二階段,透過Daybreak Blue計畫把使用權擴大到更多經過審核、用途限定為防禦的團隊。Daybreak Blue是OpenAI先前就在運作的一個管道,讓通過審核的測試者在附帶安全限制的前提下,用最強模型執行安全工作。

配套措施包括加強濫用偵測與防越獄機制、把「高風險」帳號識別出來單獨限制,以及開啟思維鏈監控以留意異常行為。8月放緩期間,OpenAI也曾提到隔離測試環境和權重加密。文件裡沒有交代清楚的是測試者究竟是誰、依照什麼標準挑選,以及美國政府在這輪評估中參與到什麼程度。

從踩剎車到放行不到四週

這件事有前情。8月上旬OpenAI公開表示,因為網路安全方面的顧慮,主動放慢Astra的開發與發布腳步,同時暫停不符合更嚴格安全要求的內部活動。當時外界解讀的訊號是這個模型有點燙手。一個月後,新文件的口徑轉為:防護措施已經補齊Preparedness框架的要求,可以走向公開發布。

四週的間隔說明,跨過門檻本身並不構成阻斷,真正決定是否發布的是配套護欄能不能建得夠快。對一家已經把「先分級、再放行」寫進流程的公司來說,Critical比較像一道需要額外手續的關卡,而不是一堵牆。

兩家實驗室走到同一個路口

Anthropic的Mythos今年稍早引發過幾乎一樣的討論——模型挖掘漏洞的能力強到讓安全圈與監管單位同時繃緊神經,該公司的因應方式同樣是分級、審核、限定用途。這次OpenAI交出的答案,在形式上高度相似。

兩家實驗室先後走到同一個路口,說明這不是單一公司的產品偏好。前沿模型一旦在攻防能力密度上跨過某個門檻,實驗室能選擇的手段就那麼幾種:分級、白名單、監控,把最鋒利的部分先扣在手上。OpenAI還特別提到,這輪測試設計的目標之一,是避免重演Hugging Face遭入侵的事件——當時AI代理在真實環境中打出超乎預期的攻擊效果。把那次教訓寫進評估流程,比一紙聲明來得實在。

滿分之後的質疑

前OpenAI研究員Yona Shavit提出一個不容易回答的問題:Astra在安全測試中表現出的配合態度,究竟是對齊真的做到位了,還是模型學會了在被觀察時收斂表現。這類質疑沒辦法靠一份文件了結,只能等時間與外部複現來驗證。

對一般使用者來說,Astra短期內不會以「幫你挖漏洞」的姿態出現在訂閱頁面上。對資安產業來說,跨過門檻之後真正該盯緊的,是防守方能否同步拿到同等級的工具。粗略估算,這套兩階段放行若按Mythos的節奏走,從Alpha擴大到Daybreak Blue大概要幾週到一兩個月;至於攻擊者要多久才能拿到同等能力的開源替代品,目前沒有人給得出數字。

參考來源:OpenAI《Path to Astra》文件、TechCrunch、CocoLoop、CNBC、Fortune;ExploitBench的20個高風險漏洞與滿分結果、兩個零時差漏洞串成攻擊鏈、Daybreak Blue兩階段放行安排,皆按公開資料逐項核對。