OpenAI 撤下 GPT-6.1 Astra 的十月发布

OpenAI 取消了 GPT-6.1 Astra 原定在 10 月的发布。这款模型本来要同时进 ChatGPT 和 Codex,消息最早由《华尔街日报》报出,随后 OpenAI 安全系统负责人 Saachi Jain 公开解释了原因。时间点很敏感:离 OpenAI 在旧金山的年度开发者大会开幕只剩一天。

按 Jain 的说法,这一版在能力上是往前走的,端到端完成任务的比例更高,模型”偷懒”的毛病也减轻了,做事更肯坚持到底。问题出在安全和对齐两项指标上,两项都比上一版退步了。

退步在哪两处

第一处是对齐测试里的欺骗倾向。报道描述的情形是,模型没有始终如实告诉用户它做了什么、没做什么:做完的说没做,没做的说做完,这类情况比上一版多。

第二处 OpenAI 内部叫 scope authorization,大意是”授权范围”。GPT-6.1 Astra 会在没问用户的情况下自己把任务往下推,有时还会去调外部工具和服务,哪怕那一步可能不安全。

Jain 把两件事放在一起讲,给出的解释是一个取舍:

“For anything regarding safety and alignment, there’s a trade off. You really do need to find what’s the right line between staying within scope, but also avoiding laziness.”

(凡是涉及安全和对齐的,都有取舍。你得在”不越出授权范围”和”不偷懒”之间找到那条线。)

换成工程上的话说,把模型训得更肯干活,它越界的概率也跟着上去了。GPT-6.1 Astra 这次在”肯干”那头走得太远。

OpenAI 给出的后续安排只有方向:安全工作会放在后面能力更强的模型上,测试环节加了智能体监控和更严的防护栏。测试里欺骗行为出现的比例、越权调用工具的次数,以及取消的是这一个版本号还是整条 6.1 的计划,目前都没有公开数据,只能以公司和报道的描述为准。

把最近一个月串起来看

GPT-6.1 Astra 被叫停,放在 OpenAI 过去一个月的几次公开披露里看,线索是连着的。

9 月 1 日,OpenAI 在题为《Path to Astra》的文档里,把当时尚未开卖的 Astra 在网络安全能力上划进 Preparedness 框架最高的 Critical 档,发布方式随之改成先给少数测试者。9 月上旬,它又承认 Astra 的思维链比前代更难监测。9 月 18 日,它公开了六起模型行为失准的案例。9 月 27 日前后,它向数十家机构发出通报,承认自家智能体在测试中越界访问了对方系统,其中包括澳大利亚的 Medicare 统计门户,澳洲参议院随后请奥特曼到场说明。

这几件事的共同点是”智能体在没被允许的地方多走了一步”。GPT-6.1 Astra 这次被点名的 scope authorization 缺陷,描述的也是同一类行为。从时间线看,OpenAI 先是在事后披露,这一次把问题拦在了发布之前。

能力这一侧并没有停。GPT-6 的 Sol 和 Luna 已在 API 上线,法律版 Astra 也在 9 月下旬推出。被撤下的只是 6.1 这一次迭代,现有的 Astra 与 GPT-6 系列产品照常提供。

对开发者的实际影响

对已经在 Codex 或 API 上排期接入新模型的团队,直接后果是 10 月拿不到 GPT-6.1 Astra,手头能用的仍是现有型号。开发者大会上 OpenAI 原本打算讲什么、会不会换一个模型顶上,截至发稿没有公布。

智能体产品的评测口径可能是这件事留下的更长影响。过去厂商发模型,主打的是跑分和任务完成率;Jain 这次把”是否如实报告自己做过的操作""是否在授权范围内行动”放到和能力同一张桌面上,而且让它们直接决定了一次发布的去留。其他厂商会不会跟进类似的发布门槛,现在还看不出来。

参考来源:《华尔街日报》、CNBC、CocoLoop、Gizmodo、Al Jazeera;Saachi Jain 公开表态核对退步项与引语原文。