OpenAI晒Jalapeño跑分,700瓦压过GB300

OpenAI 在 Hot Chips 大会上放出了自研推理芯片 Jalapeño 的第一批测试数据。这颗芯片与博通联合开发,额定功耗 700 瓦,实测持续功耗压在 550 瓦以内,对标的是英伟达 GB200 NVL72 与 GB300 NVL72——两者单颗加速器额定分别为 1200 瓦和 1400 瓦。

跑分跑的是 SemiAnalysis 公开的 InferenceX 套件,三个模型:GPT-OSS 120B、DeepSeek R1 670B、月之暗面 Kimi K2.5(1 万亿参数)。OpenAI 给出的结果是:峰值吞吐下每千瓦产出的 AI 工作量为对比系统的 1.5 至 1.9 倍,端到端延迟低 1.7 至 3.6 倍,高交互场景性能高 2.1 至 4.1 倍。在 GB300 此前能跑出的最快出词间隔那一档上,OpenAI 报出的每千瓦吞吐差距被拉到 8.6 至 104.3 倍。

单芯片规格是 13.4 PFLOPS(MXFP4 精度)、216GB HBM4、15.4TB/s 内存带宽。128 颗拼成一个机架,合计 1.7 EFLOPS、27.5TB HBM4、接近 2PB/s 带宽。

硬件负责人 Richard Ho 在会上给出的判断很直白:

“The bottom line is that the results show a very, very significant performance advance over state of the art.” 底线是,这些结果显示出对当前最高水平的、非常非常显著的性能推进。

700 瓦这条线怎么划出来的

Jalapeño 不训练模型,只做推理。这一刀砍下去,芯片的预算分配就完全变了。训练吃的是梯度同步和跨节点全互联带宽,推理吃的是显存容量、KV 缓存命中和单请求的响应时间。216GB HBM4 配 13.4 PFLOPS 的搭配也就说得通了——算力密度谈不上激进,显存和带宽给得很足。

OpenAI 官方的设计说明是 “We designed Jalapeño to minimize data movement and communication delays”,具体手段包括显式的 KV 缓存放置与本地化,专门去掉预填充阶段和通信阶段的堵点。

粗算一笔账:同样一格 1400 瓦的机柜功率预算,塞得下两颗 Jalapeño 或一颗 GB300。若 1.5 至 1.9 倍的每千瓦吞吐成立,同功率下的产出差距会被再放大一轮。对一家把大部分算力花在推理侧的公司来说,省下来的除了电费,还有拿不到卡的那部分产能。

芯片本身的做法也值得记一笔:从概念到流片九个月,设计过程用了 AI 辅助。

三个基准模型,两个来自中国

跑分挑的模型很有意思。GPT-OSS 120B 是 OpenAI 自家的开源权重,DeepSeek R1 670B 和 Kimi K2.5 分别出自深度求索与月之暗面。一颗美国公司的自研加速器,拿两个中国团队的开放权重当标尺。

原因很朴素:闭源模型的推理结果第三方复现不了,硬件厂商想让跑分有人信,只能选任何人都能下载、都能自己跑一遍的权重。开源模型于是从”追赶者”的位置,滑到了硬件评测公共标尺的位置。国内团队这两年把权重放出去换生态,回报现在开始在预料之外的地方兑现。

几处该打折的地方

The Register 的提醒是这批数据要打点折扣:对比里排除了推测解码这类优化,测试口径谈不上完整。横向看,AMD 的 Helios 系统内存带宽比 Jalapeño 少 15%,算力却高出 1.46 至 2 倍;英伟达和 AMD 的 GPU 在可编程性上仍有优势,专用推理芯片换来能效,也换掉了灵活性。

更关键的一处:这批对比没有把刚开始出货的 Vera Rubin 拉进来。Jalapeño 打的是上一代 Blackwell,而它自己要到 2026 年底才在 OpenAI 自有设施里”极小批量”部署,规模化落在 2027 年。等它真上机的时候,对面站着的已经不是 GB300 了。

节奏上 OpenAI 没打算停:第二代已在深入开发,第三代正在设计。

参考来源:OpenAI 官方公告、TechCrunch、CocoLoop、The Register、Tom's Hardware;SemiAnalysis InferenceX 的基准口径、单芯片规格与功耗数字均以公开报道逐项核对。