OpenAI 在 9 月 6 日发布的《Research acceleration: The view inside OpenAI》里宣布,公司已经达成”自动化研究实习生”这一内部目标。报告把它定义为:一套能在人类指导下完成定义清晰的研究任务的系统,包括那些熟练研究员要花几天才做得完的任务。
支撑这个说法的是一组内部使用数据。截至 8 月中旬,AI agent 每对应研究员一个标准八小时工作日,能记到 3.1 个 agent 工作日的工作量。同期研究员的日均推理开销中位数超过 600 美元,90 分位用户超过 7000 美元。同时挂着四个以上 agent 跑的研究员在变多。报告还提到,2026 年 8 月单位活跃研究员的实验数,是 2025 年 1 月开始统计以来的最高值。
报告自己列出的限制条件
这份文件没有把话说满。成功率只在有明确 ground truth 的任务上统计,那些拿不到客观对错的研究工作不在其中。复杂度落在四到八小时区间的任务里,超过一半仍然需要人介入才能收尾。文中直接写了”The measurements are preliminary”,并且提醒各种潜在瓶颈可能让整体研究节奏跟不上单项指标的涨幅。
关于终局,报告的措辞是”We do not yet know how to safely get all the way to aligned, full RSI”——通向完全递归自我改进的安全路径,公司承认自己还没有摸清。
3.1 这个数字目前无法被外部核实。它依赖 OpenAI 对”agent 工作日”的内部换算方式,而这套换算的口径没有公开。
上一次给出时间表是十一个月前
这两个节点不是新提出来的。2025 年 10 月的一场直播里,Sam Altman 讲过一段话:
“we think it is plausible that by September of next year, we have an intern-level AI research assistant and that by March 2028, we have a legitimate AI researcher.”
我们认为有可能在明年九月拿到实习生水平的 AI 研究助手,到 2028 年 3 月拿到一名像样的 AI 研究员。
按 OpenAI 自己的口径,第一个节点在预定的月份兑现了。第二个节点仍挂在 2028 年 3 月,报告对它的描述是:一个能在人类监督下推进深度学习与对齐研究、支持迭代改进的自动化 AI 研究员,而不是只能接窄任务的助手。
这条线上还有两个不那么顺利的节点被写进了同一份报告。7 月 20 日,公司的容器服务在一次安全问题之后临时关停。8 月 7 日,Astra 被标记为具备关键网络安全能力。把研究吞吐拉起来的这套内部工具链,本身也在制造需要处理的安全事项。
账单跟着一起涨
推理开销那组数字比 3.1 更容易验证方向。研究员日均 600 美元的中位数,意味着一支百人规模的研究团队光是 agent 调用一年就要六千万美元量级的算力开销,这是按 250 个工作日粗算的结果,不含训练。90 分位那 7000 美元一天的用户,单人一年就能跑到接近两百万美元。
这笔钱的性质跟训练算力不同。训练是一次性投入,跑出来的模型能反复用;研究员用 agent 做实验是纯消耗,用完就没了,而且用得越顺手花得越多。报告里那条”同时跑四个以上 agent 的人在变多”的观察,指向的正是这条开销曲线的斜率。
对外部观察者来说,2028 年 3 月是下一个可以对表的节点。在那之前,能拿来交叉验证的公开材料仍然只有 OpenAI 自己发布的报告。
参考来源:OpenAI 官方研究加速报告、CocoLoop、unite.ai;OpenAI 报告页核验 3.1 agent 工作日比值、推理开销中位数与 90 分位口径、四至八小时任务的人工介入比例,以及 Altman 关于两个时间节点的原话。