OpenAI 正准备把 Ultrafast 推理模式开放给更多开发者。9 月 26 日有外媒发现,Responses API 的 Playground 界面里藏着一个还没启用的速度选项,分 Standard、Fast、Ultrafast 三档。放开的时间点可能落在 9 月 29 日的 DevDay 前后,OpenAI 尚未就此发布公告,具体范围以官方口径为准。
Ultrafast 眼下只对少数受邀客户开放。如果三档选项正式上线,速度会从一项内测特权变成普通开发者按任务挑选的计费选项。
8 月预览时给过的数字
Ultrafast 在 8 月 13 日以有限预览的形式亮相,只挂在 GPT-5.6 Sol 一个模型上。OpenAI 的说法是,它每秒最多输出 750 个 token,比 Standard 处理快至多 14 倍,底层算力来自 Cerebras 的晶圆级芯片。
Cerebras 特意强调,这一档跑的不是蒸馏或量化过的缩水版:模型结构、权重、精度、上下文配置和推理设置,都和标准端点上的 GPT-5.6 Sol 一致。速度差距来自硬件,每颗晶圆级芯片带 44GB 片上 SRAM,权重常驻芯片,省掉了在显存和计算单元之间来回搬数据的时间。
预览期的限制也写得清楚:只在 API 里提供,ChatGPT 和 Codex 用不上,扩容节奏跟着算力走。
Cerebras 自己放出过两组对比。在衡量知识工作的 GDP-Val 测试里,Ultrafast 端到端提速 5.6 倍、质量不降;跑完 Humanity’s Last Exam 的 2500 道题,Ultrafast 版用了 11 小时 11 分钟,Claude Fable 5 用了 78 小时 27 分钟。这两组数都出自 Cerebras 博客,测试条件由它自己设定,目前没有第三方复现。
“It now finishes for me before I even have the opportunity to context-switch.” OpenAI 研究员 Jeffrey Wang 的原话,意思是还没来得及切去干别的事,结果已经出来了。
和 Cerebras 的第三步
把 OpenAI 跟 Cerebras 的合作串起来看,Ultrafast 是第三个节点。
今年 1 月,OpenAI 与 Cerebras 签下算力协议,约定到 2028 年前陆续部署 750 兆瓦容量。2 月的 GPT-5.3-Codex-Spark 是第一次落地,那是一个专门做过瘦身的编程模型,跑在 Cerebras WSE-3 上,每秒超过 1000 个 token,只给 ChatGPT Pro 里的 Codex 用。4 月又传出 OpenAI 追加约 200 亿美元的采购承诺。
Codex-Spark 的做法是为快而单独做一个小模型,Ultrafast 换成了让旗舰模型原样跑在快硬件上。前者牺牲了一部分能力,后者不牺牲能力,代价转移到了算力成本上。Cerebras 的产能能不能撑住更大范围的开放,决定了这次放宽到底放多宽。
三档怎么分
三档并列之后,开发者可以按任务选延迟。编程助手、实时客服这类有人盯着屏幕等结果的场景,速度直接影响体验;夜里跑的批处理和评测任务,慢一点换便宜更合适。同一个模型按响应速度分档,思路接近云厂商按实例规格收费。
还有两件事没有答案。一是价格,Ultrafast 从预览到现在没有公布过单价,Fast 档和它的差价也不清楚。二是覆盖范围,GPT-6 Sol、GPT-6 Astra 已经陆续推出,目前无法确认每个 GPT-6 型号在发布时都支持 Ultrafast。
DevDay 当天如果真的上线,定价页会是开发者第一个要看的地方。
参考来源:OpenAI 开发者社区 Ultrafast 预览公告、Cerebras 官方博客、CocoLoop、TestingCatalog;核验每秒 750 token、14 倍提速与 GDP-Val 5.6 倍提速均为 OpenAI 与 Cerebras 自报口径。