8 月 18 日,OpenAI 公開了一項內部已經進行一段時間的處置:次世代模型 Astra 的網路安全能力評估未能得出「安全」的結論,公司隨即暫停了最新部署模型的強化學習訓練,為期兩週;截至發文,規模最大的那批前沿強化學習仍未重啟,只有較小規模的訓練與評測照常進行。
這則消息第一次曝光是在 8 月 7 日,當時外界看到的版本是「OpenAI 延後 Astra 上線」。8 月 18 日這篇文章把延後背後的判斷過程攤開來看:內部評測顯示,Astra 在自主寫程式與網路攻防兩個方向上的進展,讓公司無法排除它已經觸及 Critical 等級的可能性。
門檻寫得比想像中具體
OpenAI 的 Preparedness Framework 把網路安全的 Critical 門檻,落實成兩條可判定的能力描述:模型能自主寫出可用的零日漏洞攻擊手法,且鎖定對象是多個已經強化過的真實關鍵系統;或者只給一個高層次目標,模型就能自行設計並執行一次針對強化目標的全新端到端攻擊。
內部評測的結論停在「無法排除」這一階,並未確認達標。但從公司後續的動作看,這個判斷已經足以觸發一輪預防性減速——不必等到確認,先把最耗運算資源、最可能把能力再往上推的那批訓練停下來。
停的是訓練,改的是機房
暫停只是措施的一半。OpenAI 同時列出一組基礎設施層面的變動:把沙盒隔離與網路分離做得更嚴謹,移除容易被攻破的共用服務,收斂長期有效的權限,補齊安全日誌的缺口。大量 Astra 的工作負載至今仍被擱置,等待遷移進符合新規範的環境。
監控這塊給出最直接的數字。新上線的監控系統由兩部分組成:一個在 token 層級運作的啟動分類器,負責在生成過程中標記可疑行為;一個自動化調查系統,負責把被標記的內容重新檢查一遍。這套監控消耗的運算資源,約占推論運算資源的 20%。告警的目標回應時間訂在 30 分鐘以內,安全團隊排除誤報的時間窗口同樣是 30 分鐘。
20% 寫在紙面上像是個工程參數,換算成支出就不一樣了。前沿實驗室的推論運算資源年度開銷普遍落在數十億美元量級(粗估,各家計算方式不同),把其中兩成常態化撥給監控,對應的是十億美元等級的固定成本,而且這筆錢完全不會產生任何面向使用者的產能。願意長期背負這筆帳,說明公司預期風險視窗不會在幾週內關閉,而是要覆蓋下一代模型的整個生命週期。
另一條可以比較的路線,是優先把攻防能力交到防守方手上,透過限定名單開放漏洞挖掘模型,用可控的部署範圍換取時間差。OpenAI 這次的選擇更偏向上游,直接在訓練端踩煞車。兩條路線瞄準的其實是同一個判斷:模型的攻擊能力成長得比防守端的修補流程還快。
一道自己設給自己的關卡
這整套流程裡,沒有外部監管的位置。觸發條件、評估標準、暫停時長、重啟門檻,全部由 OpenAI 自己訂、自己判、自己執行,對外只有一篇事後說明。Critical 門檻究竟怎麼測、Astra 在各項測試中拿到什麼分數,文章都沒有給出可供第三方覆核的數字。公司另外澄清一點:先前引發討論的 Hugging Face 沙盒事件與 Astra 無關。
對緊盯進度的開發者來說,短期影響集中在兩處:Astra 相關功能的上線時程會往後延;已經在跑的 Astra 工作負載得跟著遷移環境,節奏由 OpenAI 單方面掌控。至於規模最大的前沿強化學習何時重啟,公司目前沒有給出說法。
參考來源:OpenAI 官方部落格、Axios、CocoLoop、AIGC News;Preparedness Framework 的 Critical 門檻定義、20% 的監控運算資源占比與 30 分鐘的告警視窗,皆已依 OpenAI 公開說法核對。