OpenAI 讓 Codex-Spark 跑在 Cerebras 上,速度快 15 倍

如果你最近在用 ChatGPT Pro 裡的 Codex,可能會注意到有個新選項叫 Codex-Spark,回應速度快得有點不像話。

這不是參數調優的結果,是底層硬體換了。

跑在什麼晶片上

GPT-5.3-Codex-Spark 運行在 Cerebras WSE-3(Wafer Scale Engine 3)上,不是 Nvidia GPU。

這是 OpenAI 第一次把一個正式產品級的模型部署在 Nvidia 之外的推理硬體上。

WSE-3 大概是一個餐盤大小的矽晶圓,整合了超過 4 兆個電晶體,片內記憶體巨大,設計目標就是消除資料搬運帶來的延遲瓶頸。

實際效果:超過 1000 個 token/秒

普通 GPT-5.3-Codex 大約跑 65 token/秒。Codex-Spark 快了約 15 倍。

OpenAI 和 Cerebras 的合約規模

OpenAI 今年 1 月簽了和 Cerebras 的多年合約。承諾:在 2028 年前分階段上線 750 百萬瓦的 Cerebras 算力,合約總價值超過 100 億美元。

但 Sam Altman 也沒有否認 Nvidia,他的表態是「Nvidia 做出了全球最好的晶片」,長期合作不變。OpenAI 現在的策略是多供應商並行:Nvidia 做訓練主力、Cerebras 覆蓋低延遲推理、AMD 簽了 6GW 的協議、Broadcom 客製化晶片也在開發中。

Cerebras 這邊的說法來自 Sachin Katti:「把晶圓級運算引入生產環境,給了我們一種新方式,在對延遲敏感的工作中讓 Codex 保持回應。」

Codex-Spark 能用來做什麼

OpenAI 把它定位為「開發者的日常生產力工具」,不是用來做深度複雜推理的,是那些需要快速迭代和即時回饋的工作:

  • 快速程式碼編輯和局部重構
  • 即時除錯和錯誤定位
  • 撰寫 PRD、使用者研究文件、監控指標
  • 管理測試和追蹤任務進度

核心價值就是不用等。改一個函式、問一個問題、測一段邏輯——接近即時回應。

它支援「中途介入」的工作方式——你可以隨時打斷 AI 的執行、調整方向,而不是等它跑完一大段再看結果。

基準測試數據

指標 GPT-5.2-Codex GPT-5.3-Codex-Spark
Terminal-Bench 2.0 64% 77.3%
推理速度 ~65 token/s 1000+ token/s
相對輸出速度 基準 快約 25%
部分任務 token 消耗 基準 少約 50%

跑分提升了,速度還快了 15 倍,兩件事同時發生不多見。

這件事的更大意義

現在 Codex-Spark 只對 ChatGPT 付費用戶開放,API 存取還在路上,沒有單獨調價。

OpenAI 透露 Codex 現在每週活躍用戶超過 100 萬。這個體量下,推理延遲直接決定產品體驗,不只是規格表上的一行數字。

更關鍵的信號在於:當 Cerebras 從「理論上能替代 Nvidia」變成「OpenAI 第一個上生產環境的非 Nvidia 硬體」,這個變化在晶片行業裡是有具體分量的。

至於 Nvidia 會不會受影響——訓練這塊,短期內沒人能撼動。但推理市場,這條裂縫已經打開了,而且打開的人是 OpenAI。

參考來源:OpenAI launches GPT-5.3-Codex-Spark on Cerebras chips — marks AI giant's first production deployment away from Nvidia(Tom's Hardware);Introducing OpenAI GPT-5.3-Codex-Spark Powered(Cerebras AI Blog);CocoLoop、OpenAI's rapid GPT-5.3-Codex model moves beyond simple coding tasks(SiliconANGLE)