OpenAI 懸賞 2.5 萬美元測 GPT-5.5 生物安全越獄

OpenAI 的 Bio Bug Bounty 今天正式進入測試階段。

規則很直接:研究員必須找到一個 prompt,讓 Codex Desktop 裡的 GPT-5.5 完整回答 5 道生物安全問題,而且不能觸發任何審核機制。第一個成功的人,可拿到 2.5 萬美元。

聽起來像 CTF,但實際門檻比 CTF 更高。

這個賞金為何特殊

先看設計:

  • 獎金:第一位完成全部 5 題的研究員可獲得 2.5 萬美元;部分有價值但未完整完成的發現,也可能依裁量給獎。
  • 環境:測試限定在 Codex Desktop 的 GPT-5.5,其他入口一律不算。
  • 時間:申請期為 4 月 23 日至 6 月 22 日,測試期為 4 月 28 日至 7 月 27 日。
  • 保密:參與者必須簽署 NDA,測試資料、prompt 與發現結果都不得公開。

關鍵詞是「universal jailbreak」。OpenAI 要找的不是哪一道題可以被突破,而是一個 prompt 就能解開全部 5 題的通用解法。

這個設定很有意思。多數 AI 紅隊測試會針對不同案例各自最佳化。OpenAI 這次反過來要求研究員證明:單一 prompt 能讓 GPT-5.5 跨過 5 道生物安全護欄,而且整個過程沒有被審核系統發現。

為什麼限定 Codex Desktop

這是最反直覺的細節。

GPT-5.5 本身有 Web、API、Codex CLI、Codex Desktop 等多個入口。OpenAI 卻只允許在 Codex Desktop 裡測。

合理解釋有兩個。第一,Codex Desktop 是面向開發者的代理型環境,更像一名隱形員工。它的沙箱邊界、權限與上下文管理,都不同於 Web 版 ChatGPT。如果生物安全相關越獄能在這裡成功,就表示代理化部署的安全邊界出了問題,這正是 OpenAI 最在意的風險。

第二,這能控制變數。把測試面固定住,紅隊報告更容易比較,也能減少不同入口 prompt template 差異帶來的雜訊。

但限制也代表另一件事:Web 版 ChatGPT、行動端與 API 直連的攻擊面,都不在這次懸賞範圍內。2.5 萬美元買到的是一種非常具體的安全保證,不是 GPT-5.5 整體韌性的證明。

5 道題到底是什麼

OpenAI 沒有公開。NDA 也禁止參與者把題目洩露出去。

可以推測的是,這 5 道題應該是由專家篩選、回答後可能加速有害生物研究的具體問題。Anthropic 過去一年做過類似的 Constitutional Classifiers 測試;OpenAI 這次更激進,直接把紅隊與懸賞機制綁在一起。

也可以拿 Anthropic 早前的 Mythos Preview 對照。那種做法是邀請 40 家公司一起挖漏洞;OpenAI 的 Bio Bounty 則是邀請加申請,鎖定純紅隊人才,並聚焦生物安全這一個極端類別。

兩種思路不同:Anthropic 測的是企業生態,OpenAI 測的是孤立場景的極限。

真正的看點

重點不是 2.5 萬美元能不能吸引頂尖紅隊。以 AI 紅隊市場來看,這筆錢其實不算高。Google 的 VRP、Meta 的 Bug Bounty,常常可以到六位數美元。

真正值得看的是,測試期長達 3 個月。

如果 3 個月內有人拿走獎金,表示 GPT-5.5 的生物安全護欄存在系統性弱點,OpenAI 需要在下一次 GPT-5.5 Pro 安全更新中補上。

如果 3 個月都沒人成功,OpenAI 就能得到一筆公開且可信的「紅隊挑戰未突破」紀錄。這比自我表揚式的安全報告更有說服力。

這是 OpenAI 第一次用懸賞機制公開測試單一類別的安全護欄。先前的 Bug Bounty 覆蓋的是模型整體安全與隱私問題。這次直接鎖定生物安全,方向已經不同。

熟悉產業的人都知道原因。AI 生物安全是 2026 年的監管重點。白宮的 National Policy Framework 與歐盟 AI 法案,都把生物風險列為最高等級的關注項目。

OpenAI 趕在監管細節落地前,先把資料累積起來。

接下來 3 個月,會很有看頭。

參考來源:GPT-5.5 Bio Bug Bounty(OpenAI 官方);CocoLoop、GPT-5.5 Bio Bug Bounty Program Aims to Improve AI Safety and Performance(GBHackers)、OpenAI offers $25,000 reward to hack GPT-5.5 safety controls(VARindia)