Fortune 在 9 月 4 日报道,OpenAI 发布 GPT-6 Astra 的博客文章上线之后,页面里的评测数据被多次修改,部分指标改完又改了回来。
时间线可以对着互联网存档一格格看。9 月 3 日美东时间下午 2 点,博客首次发出后被撤回;2 点 23 分留下第一个存档快照;3 点 32 分 OpenAI 的 X 账号发出链接,那条链接是坏的;3 点 50 分 Sam Altman 转发;到 5 点 20 分的第六个快照,表里的数字已经变了。9 月 4 日,数字还在继续动。
改了哪几项
幻觉率这一栏动得最明显。Astra 从 4.2% 改到 2.0%,随后改回 4.2%;作为对照组的 GPT-5.6 Sol 从 12.2% 改到 9.4%,同样又回到 12.2%。一降一回,两个模型的相对位置没变,但中间那一版流出去的截图,把差距做小了一半以上。
数学这一栏改的是别人家的分数。FrontierMath Tier 4 v2 上,Astra 自己的 97.6% 全程没动;Anthropic 的 Fable 5.1 从 87.8% 被调到 78%,最后停在 83%;GPT-5.6 Sol 从 83% 调到 80.5%,也回到 83%。竞品的分数一度被砍掉近 10 个百分点。
网络安全方面,GPT-5.6 Sol 的 ExploitBench 成绩从 5.5% 上调到 11.5%。这一项是否回退,Fortune 报道时仍在核实。
此外 ARC-AGI-3 的成绩在禁发稿版本里是 98.6%,正式发布时写成 99.99%;编码那一栏有一处小改动,57.7% 变成 57.9%。
OpenAI 发言人对此的回应是:“We care deeply about getting evaluations right. Most evaluations have noise within a few percentage points…”(我们非常在意把评测做对,多数评测本身就带有几个百分点的噪声)。
外部研究者的看法不完全一致。Anka Reuel 和 Mike Hardy 的说法是:“This can be done in a very tight timeframe, and it’s better for their marketing.”(这类调整可以在很短的时间里完成,而且对他们的营销更有利。)Snorkel AI 的 Vincent Sunn Chen 则倾向于流程解释:“It’s usually a function of final launch logistics.”(通常是最后阶段发布流程的产物。)
这些分数是在什么条件下拿到的
博客页脚有一行免责声明写着”Evaluation scores are the maximum at any effort”——分数取的是各档算力投入下的最好成绩。这句话的分量比表格里任何一次改动都大。
ARC-AGI-3 那一项能说明差别有多大。Arc Prize Foundation 自己测出来的结果是:配上强力 harness 时成绩到 99.9%,换成标准 harness 只有 63%。同一个模型,同一套题,差出 36 个百分点,区别在外面那层调度代码。
对中文社区的读者来说,这一层信息在传播中通常会掉光。跑分表传到国内多半只剩数字和排名截图,harness 配置、effort 档位、评测版本号都不会跟着走。而普通用户实际能碰到的是产品化之后的 ChatGPT 或 API 默认档,跟”任意投入下的最大值”隔着好几层。
Fortune 还提到,OpenAI 的系统卡缺少详细的评测方法学文档,这让外部复现变得困难。至于这几轮修改具体由谁发起、依据什么,公开材料里没有说明,OpenAI 的回应也没有涉及。
可核对的部分只有存档
这件事里唯一硬的证据是互联网存档留下的六个快照。它们能证明数字变过、什么时候变的、变成了多少,但证明不了改动的动机。
发布日的评测表被当成新闻事实引用,这是行业里默认的做法。Astra 这一次的记录说明,引用时最好带上抓取时间。
参考来源:Fortune、CocoLoop、Arc Prize Foundation、OpenAI 官方博客;Fortune 报道核验各快照的时间点与幻觉率、FrontierMath、ExploitBench、ARC-AGI-3 各项分数的前后变化,OpenAI 博客页核验分数取值口径的免责声明原文。