OpenAI 首席财务官萨拉·弗里尔 9 月 8 日在高盛 Communacopia 大会上说,公司已经把自家前沿模型用在了芯片设计上,自研推理芯片 Jalapeno 从设计到定稿只用了 9 个月。她同时把芯片设计、生命科学和金融服务列为公司要重点进的三个行业,理由是这些领域对围绕专门工作流搭建的 AI 需求在涨。
Jalapeno 是 OpenAI 与博通联合开发的推理芯片,今年 6 月对外宣布,用途是以更低成本跑自家模型。按公开说法,早期样片相比典型的 AI 图形处理器能省下约一半成本。芯片出货时间没有披露。
9 个月这个节奏在定制芯片里算短。一颗新的推理 ASIC 从架构定案到 tape-out,行业里通常按一年半到两年计。弗里尔的说法把这段压缩的原因归到自家模型上,但没有说明模型具体承担了哪些环节——布局布线、验证、还是更前面的架构探索。
拿 Luna 去比 GLM-5.3
价格那部分是这次发言里更具体的内容。弗里尔说 Luna 降价 80% 之后,输入价降到每百万 token 0.20 美元,输出 1.20 美元,用量随后增加了约 10 倍。她进一步把比价对象指向了中国的开源模型:
“If you’re deploying Luna and compare that to (Z.ai’s) GLM 5.3, for example, on a cloud layer, we are cheaper.” 如果你部署 Luna,拿它和智谱 GLM-5.3 在云层上做比较,我们更便宜。
这句话里的口径需要留意。她比的是”在云上部署 GLM-5.3”,也就是开源权重经第三方云托管后的实际单价,而智谱自家 API 的公开报价是另一条线:GLM-5.3 上线时给出的输出价是每百万 token 4.4 美元。同一个模型走自家 API 和走第三方云,价格可以差出几倍,因为后者要摊 GPU 占用、显存和并发利用率。OpenAI 没有公开这次比价的完整口径,也没有说明对比时假设的吞吐水平。
对国产开源一侧的实际压力
这套说法针对的场景是企业自建。过去两年国内外企业选开源权重的主要理由有两条:数据不出域,以及自己算下来更便宜。第一条不受影响,第二条正在被闭源方的降价挤压。当 Luna 的输出价压到 1.20 美元、并且还有一颗自研推理芯片在后面接着降的时候,“自己托管更省钱”这条账要重新算一遍——尤其对那些并发不高、GPU 利用率上不去的团队。
需要说清的是,弗里尔给的是卖方口径,第三方尚未对 Luna 与 GLM-5.3 在同一吞吐条件下做过公开的单价核算,智谱一侧也没有就这番比较作出回应。
参考来源:路透社、Qz、CocoLoop;多方报道核对 Luna 的输入输出单价与降价幅度、Jalapeno 的设计周期与样片成本比例,以及弗里尔的英文表述。