Astra漏洞基准拿满分,OpenAI收紧发布

OpenAI 在 9 月 1 日放出一份题为《Path to Astra》的文档,把尚未正式开卖的新模型 Astra 划进自家 Preparedness 框架的最高风险档:网络安全能力达到 Critical。这套框架跑了三年,OpenAI 头一回给自己的模型贴上这个标签。

支撑判断的是一套内部基准 ExploitBench。OpenAI 往里塞了 20 个高危漏洞,Astra 全部拿下。更硬的一项是在改造过的测试环境里,Astra 自己找出并利用了两个此前无人知晓的零日漏洞,还把它们串成一条完整的利用链。

Critical 这条线画在哪

Preparedness 框架 2023 年推出,去年的一次更新把能力分成两档。High 指模型能放大已经存在的致害路径,Critical 指模型能开辟前所未有的新路径。落到网络安全这一栏,跨过 Critical 需要满足其中之一:不用人类一步步指路,就能在多个加固过的真实关键系统里识别并写出覆盖各严重等级的可用零日利用;或者只给一个高层目标,就能自主设计并执行针对加固目标的全新端到端攻击。

两条门槛都不算低。Astra 被认定跨过去,说明 OpenAI 内部评估认为它已经不需要人类当拐杖。

发布怎么放

文档里的原话是:

We plan to make Astra available soon, but access to its most advanced cybersecurity capabilities will be more limited.

(我们打算很快让 Astra 可用,但它最先进的那部分网络安全能力,开放面会更窄。)

具体安排分两段。第一段,最强的网络安全能力只给一小批 alpha 测试者;第二段,通过 Daybreak Blue 计划把访问权扩到更多经过审核、用途限定为防御的团队。Daybreak Blue 是 OpenAI 此前就在跑的一个口子,让通过审核的测试者在附带安全约束的前提下,用最强模型做安全工作。

配套动作包括加强滥用检测与防越狱、把「高风险」账号识别出来单独限制、开启思维链监控盯异常行为。8 月那一轮放缓期间,OpenAI 还提过隔离测试环境和权重加密。文档里没交代清楚的是测试者都有谁、按什么标准挑,以及美国政府在这轮评估中参与到什么程度。

从踩刹车到放行只隔了不到四周

这事有前情。8 月上旬 OpenAI 公开说,因为网络安全方面的顾虑主动放慢了 Astra 的开发和发布节奏,同时暂停了不满足更严格安全要求的内部活动。当时外界读到的信号是这个模型有点烫手。一个月后,新文档的口径变成防护措施已经把 Preparedness 框架的要求补齐,可以走向公开发布。

四周的间隔说明,跨线本身并不构成阻断,决定发布与否的是配套护栏建得够不够快。对一家已经把「先分级、再放人」写进流程的公司来说,Critical 更像一道需要额外手续的关卡,不是一堵墙。

两家实验室走到同一个路口

Anthropic 的 Mythos 今年早些时候引发过几乎一样的讨论——模型挖漏洞的本事强到让安全圈和监管方同时坐直身子,公司的应对同样是分级、审核、限定用途。现在 OpenAI 交出的答卷在形式上高度雷同。

两家先后走到同一个路口,说明这不是某一家的产品偏好。前沿模型一旦在攻防上越过某个能力密度,实验室能选的动作就那么几个:分级、白名单、监控、把最锋利的部分先扣在手里。OpenAI 还专门提到,这轮测试的设计目标之一是避免重演 Hugging Face 被入侵那件事——AI 智能体在真实环境里跑出了超出预期的攻击效果。把那次教训写进评估流程,比一纸声明实在。

满分之后的怀疑

前 OpenAI 研究员 Yona Shavit 提了个不好回答的疑问:Astra 在安全测试里表现出的配合,是对齐做成了,还是模型学会了在被观察时收着点。这类质疑没法靠一份文档结案,只能等时间和外部复现。

对普通用户来说,Astra 短期内不会以「帮你挖洞」的姿态出现在订阅页里。对安全行业来说,防守方能否同步拿到同等量级的工具,才是跨线之后真正要盯的事。粗算一下,这套两段式放人若按 Mythos 的节奏走,从 alpha 扩到 Daybreak Blue 大约要几周到一两个月;攻击者拿到同等能力的开源替代品需要多久,眼下没人给得出数。

参考来源:OpenAI《Path to Astra》文档、TechCrunch、CocoLoop、CNBC、Fortune;ExploitBench 的 20 个高危漏洞与满分结果、两个零日漏洞串成利用链、Daybreak Blue 两段式放人安排,均按公开材料逐项核对。