如果你最近在用 ChatGPT Pro 裡的 Codex,可能會注意到有個新選項叫 Codex-Spark,回應速度快得有點不像話。
這不是參數調優的結果,是底層硬體換了。
跑在什麼晶片上
GPT-5.3-Codex-Spark 運行在 Cerebras WSE-3(Wafer Scale Engine 3)上,不是 Nvidia GPU。
這是 OpenAI 第一次把一個正式產品級的模型部署在 Nvidia 之外的推理硬體上。
WSE-3 大概是一個餐盤大小的矽晶圓,整合了超過 4 兆個電晶體,片內記憶體巨大,設計目標就是消除資料搬運帶來的延遲瓶頸。
實際效果:超過 1000 個 token/秒。
普通 GPT-5.3-Codex 大約跑 65 token/秒。Codex-Spark 快了約 15 倍。
OpenAI 和 Cerebras 的合約規模
OpenAI 今年 1 月簽了和 Cerebras 的多年合約。承諾:在 2028 年前分階段上線 750 百萬瓦的 Cerebras 算力,合約總價值超過 100 億美元。
但 Sam Altman 也沒有否認 Nvidia,他的表態是「Nvidia 做出了全球最好的晶片」,長期合作不變。OpenAI 現在的策略是多供應商並行:Nvidia 做訓練主力、Cerebras 覆蓋低延遲推理、AMD 簽了 6GW 的協議、Broadcom 客製化晶片也在開發中。
Cerebras 這邊的說法來自 Sachin Katti:「把晶圓級運算引入生產環境,給了我們一種新方式,在對延遲敏感的工作中讓 Codex 保持回應。」
Codex-Spark 能用來做什麼
OpenAI 把它定位為「開發者的日常生產力工具」,不是用來做深度複雜推理的,是那些需要快速迭代和即時回饋的工作:
- 快速程式碼編輯和局部重構
- 即時除錯和錯誤定位
- 撰寫 PRD、使用者研究文件、監控指標
- 管理測試和追蹤任務進度
核心價值就是不用等。改一個函式、問一個問題、測一段邏輯——接近即時回應。
它支援「中途介入」的工作方式——你可以隨時打斷 AI 的執行、調整方向,而不是等它跑完一大段再看結果。
基準測試數據
| 指標 | GPT-5.2-Codex | GPT-5.3-Codex-Spark |
|---|---|---|
| Terminal-Bench 2.0 | 64% | 77.3% |
| 推理速度 | ~65 token/s | 1000+ token/s |
| 相對輸出速度 | 基準 | 快約 25% |
| 部分任務 token 消耗 | 基準 | 少約 50% |
跑分提升了,速度還快了 15 倍,兩件事同時發生不多見。
這件事的更大意義
現在 Codex-Spark 只對 ChatGPT 付費用戶開放,API 存取還在路上,沒有單獨調價。
OpenAI 透露 Codex 現在每週活躍用戶超過 100 萬。這個體量下,推理延遲直接決定產品體驗,不只是規格表上的一行數字。
更關鍵的信號在於:當 Cerebras 從「理論上能替代 Nvidia」變成「OpenAI 第一個上生產環境的非 Nvidia 硬體」,這個變化在晶片行業裡是有具體分量的。
至於 Nvidia 會不會受影響——訓練這塊,短期內沒人能撼動。但推理市場,這條裂縫已經打開了,而且打開的人是 OpenAI。
參考來源:OpenAI launches GPT-5.3-Codex-Spark on Cerebras chips — marks AI giant's first production deployment away from Nvidia(Tom's Hardware);Introducing OpenAI GPT-5.3-Codex-Spark Powered(Cerebras AI Blog);CocoLoop、OpenAI's rapid GPT-5.3-Codex model moves beyond simple coding tasks(SiliconANGLE)