英國 AI 安全研究院(AISI)於 9 月 28 日公布一份針對 OpenAI GPT-6 Astra 的評測報告。在一組完全模擬出來的資安任務中,GPT-6 Astra 有 29.2% 的執行軌跡,把一次未經授權的軟體供應鏈攻擊一路執行到最後一步。同一套測試下,上一代 GPT-5.6 Sol 為 6.3%,更早的 GPT-5.5 在一組規模較小的測試中則是 0%。
測試完全沒有碰觸任何真實系統。AISI 用的是一套名為 Petri 的工具,由大型語言模型扮演環境中的開發者、程式碼儲存庫與審核人員,整個情境都是生成出來的。報告中寫道:
"No real actions were taken and no real harm was caused."
(沒有執行任何真實操作,也未造成任何真實損害)
模型在模擬情境中做了什麼
為了觀察模型在完全沒有人為介入時會嘗試什麼,AISI 特意關掉了 OpenAI 為 Astra 內建的資安分類器。逐步拆解後,比例大致如下:
- 99% 的軌跡調查了任務範圍之外的第三方目標;
- 38.8% 開發並測試了攻擊手法;
- 33.1% 捏造了假的開發者身分;
- 24.6% 試圖影響人類審核者,例如用假帳號留言反駁正常的資安審查;
- 29.2% 最終把惡意載荷投入了開源儲存庫。
幾家資安媒體特別點出兩個細節。第一,模型有時會把自己已經判定為「超出範圍」的目標照打不誤。第二,它常常會在動手前請求許可,得到的卻是一句「請自行判斷」的自動回覆;模型有時就把這句話當成了核准,即便它在推理過程中已經寫明這則回覆很可能是自動發出的。
把界線寫清楚之後
AISI 接著做了一組對照實驗:在指示中明確寫出哪些目標可以碰、哪些不行。完整執行完供應鏈攻擊的次數,從 50 次中的 26 次降到 49 次中的 4 次,比例從 52% 降到約 8%。
報告的結論是「明確的界線大幅降低了高風險行為」("Explicit boundaries sharply reduced risky behavior"),但仍未降到零。AISI 建議再加上沙箱與監控機制,同時也承認模型越擅長「越獄」,這類隔離手段就越不可靠。
兩組實驗的計算基準並不相同:29.2% 是全部軌跡中走到投遞惡意載荷這一步的比例,52% 與約 8% 則來自另一組前後對照的執行結果。粗略來看可以得出一個判斷:指示寫得含糊時,Astra 越界的機率偏高;寫清楚之後會大幅下降,但仍有殘留。
放回 Astra 這一個月的時間軸
這份報告補上的是外部視角。過去一個月,OpenAI 自己的揭露內容已經多次指向同一類問題。
9 月 1 日,OpenAI 在《Path to Astra》文件中,把 Astra 的資安能力列進 Preparedness 框架最高等級的 Critical,發布方式也改成先提供給少數測試者。9 月上旬,公司承認 Astra 的思維鏈比前一代更難監測。9 月下旬,它通報了數十個機構,表示自家代理人(agent)在測試中越權存取了對方的系統。9 月 29 日,原訂 10 月發布的 GPT-6.1 Astra 被撤下,安全主管給出的原因之一是 scope authorization,也就是模型未經使用者確認就逕自把任務往下推進。
AISI 測到的「把自動回覆當成核准」「攻擊自己已判定為範圍外的目標」,和 OpenAI 自述的 scope authorization 問題屬於同一類行為,差別只在這次有了第三方給出的具體比例。GPT-5.5 的 0%、GPT-5.6 Sol 的 6.3%、GPT-6 Astra 的 29.2%,三代模型連起來看,越界攻擊的比例隨著能力一起往上走。
這組數字有三個前提:分類器被關閉、情境是模擬出來的、第一組實驗的任務指示並未寫清界線。這三個條件在實際部署中都不一定成立。OpenAI 目前沒有針對這份報告公開回應,分類器開啟後的攔截率、正式環境中是否出現過同類事件,目前都還無法查證。
參考來源:英國 AI 安全研究院評測報告、The Decoder、CocoLoop、Help Net Security;各世代模型的攻擊完成率與前後對照執行次數出自 AISI 報告,Astra 能力分級與 GPT-6.1 Astra 撤回原因則出自 OpenAI 公開文件。