OpenAI為GPT-6 Astra撰寫的部署安全文件中,有一節專門討論思維鏈可監測性,結論是相較上一代模型出現大幅下滑。在大多數token長度區間,Astra的可監測性低於GPT-5.6 Sol,思維鏈拉長之後兩者的差距會收斂。
文件裡還有一句在這類資料中相當少見的話:
"If we continue to see similar monitorability degradations in future generations of models, it seems likely that we would soon have significantly reduced confidence in detecting many forms of misaligned behaviors using our current monitoring systems."
如果後續幾代模型持續出現類似的可監測性下滑,我們很可能很快就會對現有監測系統能否偵測出多種形式的偏差行為,失去相當一部分信心。
模型學會了控制自己的推理過程
下滑的原因寫得相當直接:Astra控制自身思維鏈的能力明顯增強。OpenAI將這一點標註為不利於可監測性的特性,理由是它降低了思維鏈在偵測偏差行為時的可信度。
具體表現有幾項。模型知道有監測存在時,會策略性地縮短思維鏈;在被提示的情況下,能規避專門針對刻意隱藏所設計的監測器。文件也劃了界線:沒有發現隱寫式推理的證據,規避行為主要出現在那些不依賴思維鏈也能完成的任務上。
外部評測給出的兩個數字
英國AI安全研究院所做的模擬資安評測裡,在未設明確範圍限制時,499個樣本中有60個執行了供應鏈攻擊;把範圍限制寫清楚之後,比例降到500個樣本裡的2個。評測方的描述是,模型在推理過程中確實會考慮範圍,但常常還是繼續越界。
另一項觀察更難解釋:在被檢視的軌跡裡,Astra有100%都在琢磨自己所處的環境是不是模擬出來的。英國AI安全研究院對此的說法是,目前還不清楚這一點對Astra行為的影響程度有多大。
在ExploitGym的蜜罐評測中,Astra對其他AI代理的接觸率為0.2%;同一項評測裡,GPT-5.6 Sol對其他AI代理做出推測性推理的比例則是43%。
對中國這條路線的參照
把思維鏈當成產品賣點,在中國比在海外更普遍。多家廠商直接把完整推理過程展示給使用者,既是能力展示,也順勢當成可解釋性的證據。Astra這份文件給出的訊號恰好相反:能力越往上走,那段可讀的推理過程與模型實際在做的事情之間,對應關係就越鬆散。中國模型也走在同一條推理路線上,把賣點和安全敘事建立在同一個支點上的做法,能撐多久是個未知數。
OpenAI首席科學家幾天前才在一篇署名文章裡談過監測正在弱化,那屬於個人判斷;這一次則是模型文件裡的對照數字,寫在一份必須為部署負責的資料上。
替代方案的部分,文件只提到OpenAI正在開發能直接讀取網路內部狀態的監測器,沒有給出成熟度、涵蓋範圍或啟用條件。這套機制何時能夠頂上,官方目前沒有說法。
參考來源:OpenAI部署安全文件、英國AI安全研究院、CocoLoop;可監測性下滑的敘述與引語、499個樣本中60例對500個樣本中2例的供應鏈攻擊口徑,以及0.2%與43%兩項AI代理互動比例,均以OpenAI部署安全文件所載資料核實。