OpenAI正準備把Ultrafast推論模式開放給更多開發者。9月26日有外媒發現,Responses API的Playground介面裡藏著一個尚未啟用的速度選項,分成Standard、Fast、Ultrafast三檔。開放的時間點可能落在9月29日的DevDay前後,OpenAI尚未就此發布公告,實際範圍要以官方說法為準。
Ultrafast目前只對少數受邀客戶開放。如果三檔選項正式上線,速度就會從內測特權變成一般開發者依任務挑選的計費選項。
8月預覽時公布的數字
Ultrafast在8月13日以限量預覽形式亮相,當時只掛在GPT-5.6 Sol這一個模型上。OpenAI表示,它每秒最多可輸出750個token,比Standard最多快14倍,底層算力來自Cerebras的晶圓級晶片。
Cerebras特別強調,這個檔位跑的不是蒸餾或量化過的縮水版本:模型架構、權重、精度、上下文設定與推論設定,都和標準端點上的GPT-5.6 Sol一致。速度差距來自硬體,每片晶圓級晶片配有44GB的片上SRAM,權重常駐晶片上,省下在記憶體與運算單元之間來回搬移資料的時間。
預覽期間的限制也講得很清楚:僅在API中提供,ChatGPT和Codex都用不到,擴大的節奏要看算力狀況而定。
Cerebras自己公布過兩組比較數據。在衡量知識工作的GDP-Val測試中,Ultrafast端到端提速5.6倍,品質沒有下降;跑完Humanity's Last Exam的2500道題目,Ultrafast版本花了11小時11分鐘,Claude Fable 5則花了78小時27分鐘。這兩組數字都出自Cerebras部落格,測試條件由該公司自行設定,目前尚未有第三方複現。
"It now finishes for me before I even have the opportunity to context-switch."
這是OpenAI研究員Jeffrey Wang的原話,意思是還來不及切去做別的事,結果就已經跑出來了。
與Cerebras合作的第三步
把OpenAI跟Cerebras的合作串起來看,Ultrafast是第三個節點。
今年1月,OpenAI與Cerebras簽下算力協議,約定到2028年前陸續部署750百萬瓦容量。2月的GPT-5.3-Codex-Spark是第一次落地,那是一款專門瘦身過的程式碼模型,跑在Cerebras的WSE-3上,每秒超過1000個token,只提供給ChatGPT Pro裡的Codex使用。4月又傳出OpenAI追加約200億美元的採購承諾。
Codex-Spark的做法是為了求快而另外做一個小模型,Ultrafast則是讓旗艦模型原封不動跑在快硬體上。前者犧牲了部分能力,後者不犧牲能力,代價轉移到算力成本上。Cerebras的產能能不能撐住更大範圍的開放,將決定這次放寬究竟能放多寬。
三檔怎麼分
三檔並列之後,開發者可以依任務選擇延遲。像程式碼助理、即時客服這類有人盯著螢幕等結果的場景,速度會直接影響體驗;半夜跑的批次處理和評測任務,慢一點換便宜反而更划算。把同一個模型按回應速度分檔,思路和雲端業者依實例規格收費相近。
還有兩件事沒有答案。一是價格,Ultrafast從預覽到現在都沒公布過單價,和Fast檔的價差也不清楚。二是涵蓋範圍,GPT-6 Sol、GPT-6 Astra已陸續推出,但目前無法確認每個GPT-6型號在發布時是否都支援Ultrafast。
如果DevDay當天真的上線,定價頁面會是開發者第一個要看的地方。
參考來源:OpenAI開發者社群Ultrafast預覽公告、Cerebras官方部落格、CocoLoop、TestingCatalog;每秒750 token、14倍提速與GDP-Val 5.6倍提速的數字均為OpenAI與Cerebras自行公布的說法。