OpenAI员工98%在用Codex,付费个人用户不足1%

TechCrunch 走访 OpenAI 后给出一组内外对照的数字:今年 6 月,OpenAI 内部有 98% 的员工用过 Codex;放到公司外面,组织订阅用户里只有 17% 在用 agent 类工具,个人订阅用户里这个比例不到 1%。作为分母,ChatGPT 的提示词用户已经超过 10 亿,桌面应用装机 2000 万。

一家把 agent 当成下一代产品形态的公司,自己人几乎全员在用,客户里几乎没人用。这条缝隙比任何一份跑分都更能说明 agent 目前卡在哪。

编程之外没有验收标准

工程师用 agent 有天生的判据:代码跑不跑得起来,测试过不过,PR 能不能合。任务完成与否是二值的,用户第二次会不会再用,取决于第一次有没有真的省下时间。白领工作里没有这套判据——一份客户简报写得好不好,日程整理得对不对,只能靠人再看一遍,而”再看一遍”本身就吃掉了 agent 省下的时间。

Pi 的作者 Mario Zechner 把话说得更直接:

“Everything is coding agent shaped…the reason is that they only have training data for coding agent tasks.”

所有 agent 长得都像编程 agent,因为厂商手上只有编程任务这一种训练数据。

这句话把因果倒了过来:厂商并非偏爱开发者,可用的监督信号本来就只在代码这一块密集存在。GitHub 上堆着几十亿次公开的”改动—测试—合并”记录,每一次都自带对错标签;办公桌上的工作没有对应的语料,也没人给它打标签。想把 agent 训到能独立交付一份会议纪要,先得有人把几千万份好的和坏的纪要摆出来,这件事目前没有任何一家在做。

权限这道门槛比想象中高

桌面应用的主任工程师 Andrew Ambrosino 提到一类顾虑:让 agent 写一份文档,它会不会顺手翻到一条私人聊天记录里的内容。要让 agent 干活,就得把邮箱、日历、文件、聊天工具的读写权限交出去;要让人放心交出去,产品得先把”它能看到什么、不能看到什么”讲明白。这一层的设计成本,比多接几个工具高得多。

OpenAI 内部对此并不统一。负责 harness 的工程主管 Joe Gershenson 直言 “The honest answer is that I really don’t look at the harnesses that they’re building.”——他基本不看别人正在做的那套外壳。核心产品负责人 Thibault Sottiaux 的说法更像一句纲领:“It’s the very mission of OpenAI — to bring everyone along.”

补贴撑不到十亿人

还有一笔账没算平。TechCrunch 提到一个例子:某位用户四天里烧掉 8000 万 token,按公开价目粗算成本约 65 美元,而他付的是每月 20 美元的订阅。开发者场景里这种倒挂还能忍——付费意愿高、留存好、上限清晰;铺到 10 亿量级的普通用户身上,同样的倒挂就是一道会自己变宽的口子。

OpenAI 的应对是把单位成本往下压,比如给 Luna 模型的用户降价 80%。价格下来一档,人均用量往往涨得更快,这笔账最终要靠模型效率追上,而不是靠限流。今天 ChatGPT Plus 那条五小时窗口,本质上是在效率追上来之前先用规则挡一挡。企业侧的路子直接一些——按席位分档,重度用的人单独定价,把成本明明白白写进合同。个人订阅这一侧没有这个空间,一个月 20 美元的心理价位摆在那里,往上抬一档就掉用户。

领先了半个身位

竞争格局这一年翻了两次。Claude Code 一路领先到 2026 年 4 月,此后 Codex 拿回略微的优势。两边的差距在编程场景里已经小到要靠具体任务才分得出,而下一程的胜负手明显不在这儿——谁先让不写代码的那 99% 用起来,谁就把市场从几百万开发者换成十亿人。

从 98% 到 1% 的这段路,缺口不在模型能力这一侧。要跨过去,得让一个从没听说过”权限作用域”的人,愿意把自己的邮箱交给一段会自己跑起来的程序,并且在它跑完之后不用逐字检查。这三件事——授权、执行、免检——目前一件都没做扎实。

参考来源:TechCrunch 对 OpenAI 团队的走访报道、CocoLoop、OpenAI 公开价目页;内外部使用比例、桌面应用装机量与 token 成本口径按报道原文与公开价目核对,成本折算已标注为粗算。