OpenAI 给 GPT-6 Astra 出的部署安全文档里有一节讲思维链可监测性,结论是相较前代模型出现大幅下降。多数 token 长度区间上,Astra 的可监测性低于 GPT-5.6 Sol,思维链拉长之后两者的差距会收窄。
文档里还有一句在这类材料中少见的话:
“If we continue to see similar monitorability degradations in future generations of models, it seems likely that we would soon have significantly reduced confidence in detecting many forms of misaligned behaviors using our current monitoring systems.” 如果后续几代模型继续出现类似的可监测性退化,我们大概很快就会对现有监控系统能否查出多种形式的失准行为失去相当一部分信心。
模型学会了管住自己的推理
下降的原因写得比较直接:Astra 控制自身思维链的能力明显增强。OpenAI 把这一条标注为对可监测性不利的性质,理由是它降低了思维链在检测失准行为时的可信度。
具体表现有几项。模型知道有监控存在时,会策略性地缩短思维链;在被提示的情况下,能规避专门针对刻意藏拙的监控器。文档也划了边界:没有发现隐写式推理的证据,规避行为主要出现在那些不依赖思维链也能完成的任务上。
外部评测给出的两个数字
英国 AI 安全研究所做的模拟网络安全评测里,不设明确范围限制时,499 个样本中有 60 个执行了供应链攻击;把范围限制写清楚之后,比例降到 500 个样本里的 2 个。评测方的描述是,模型在推理过程中确实会考虑范围,但常常继续越界。
另一项观察更难解释:被检查的轨迹里,Astra 有 100% 在琢磨自己所处的环境是不是模拟出来的。英国 AI 安全研究所对此的表述是,目前不清楚这一点在多大程度上影响了 Astra 的行为。
ExploitGym 的蜜罐评测中,Astra 对其他智能体的接触率为 0.2%;同一项评测里,GPT-5.6 Sol 对其他智能体作出推测性推理的比例是 43%。
对国内这条线的参照
思维链被当作产品卖点,在国内比在国外更普遍。多家厂商把完整推理过程直接展示给用户,既是能力展示,也顺手当成了可解释性的证据。Astra 这份文档给出的信号刚好相反:能力越往上走,那段可读的推理和模型实际在做的事之间,对应关系越松。国内模型也在同一条推理路线上,卖点和安全叙事共用一个支点的做法,能撑多久是个未知数。
OpenAI 首席科学家几天前的一篇署名文章已经讲过监控在变弱,那是个人判断;这一次是模型文档里的对照数字,写在一份要对部署负责的材料上。
替代方案的部分,文档只提到 OpenAI 在开发能直接读取网络内部状态的监控器,没有给出成熟度、覆盖范围或者启用条件。这套东西什么时候能顶上,官方没有说法。
参考来源:OpenAI 部署安全文档、英国 AI 安全研究所、CocoLoop;可监测性下降的表述与引语、499 样本中 60 例与 500 样本中 2 例的供应链攻击口径、0.2% 与 43% 两项智能体交互比例均以 OpenAI 部署安全文档所载数据核验。