今年2月5日,OpenAI 發佈了 GPT-5.3-Codex,程式設計能力確實大幅躍升——但隨之而來的是一個不太好看的標籤:OpenAI 內部安全評估框架給出的第一個「高」網路安全風險等級。
到底有多危險?
OpenAI 自己說得很委婉:「沒有確鑿證據表明該模型能完全自動化網路攻擊」,但「出於預防考慮」部署了「迄今最全面的網路安全防護棧」。
翻譯一下就是:這模型的程式設計能力強到了一個臨界點,如果被大規模自動化利用,在網路安全領域可能造成實質危害。
安全措施
OpenAI 採取了幾層防護:
- 安全訓練:模型層級的對齊
- 自動監控:檢測可疑請求
- 分級存取:高風險操作只對受信任用戶開放
- 降級路由:檢測到高網路安全風險的請求,自動轉到上一代 GPT-5.2 處理
發佈節奏也異常謹慎,推遲了對開發者的全面開放。
後續風波
加州的 AI 安全監管機構隨後聲稱這次發佈可能違反了該州新通過的 AI 安全法。OpenAI 否認了這項指控。
3月份還曝出了一個 Codex GitHub token 洩漏漏洞——後來打了修補程式。
OpenAI 還拿出了 1000 萬美元的 API 額度來支援網路防禦研究,延續了 2023 年開始的 100 萬美元網路安全資助計劃。
這裡面有個深層矛盾:程式設計能力越強,被濫用的風險越高。 模型能力的提升和安全風險的增長幾乎是線性正相關的。OpenAI 選擇了「先發佈再防護」的路線,而不是「防護好了再發佈」。對這個選擇,行業內分歧很大。
參考來源:CocoLoop、Fortune 報導