OpenAI 財務長莎拉·弗里爾(Sarah Friar)9 月 8 日在高盛主辦的 Communacopia 大會上表示,公司已經把自家最先進的模型用在晶片設計上,自行研發的推論晶片 Jalapeno 從設計到定稿只用了 9 個月。她同時把晶片設計、生命科學與金融服務列為公司重點布局的三大產業,理由是這些領域對針對特定工作流程打造的 AI 需求正在上升。
Jalapeno 是 OpenAI 與博通(Broadcom)共同開發的推論晶片,今年 6 月對外公布,目的是用更低成本跑自家模型。根據公開說法,早期樣品比起一般的 AI 繪圖處理器約可省下一半成本。出貨時間尚未公開。
9 個月這個速度在客製化晶片領域算是相當快。一顆新的推論用 ASIC 從架構定案到定稿(tape-out),業界通常需要一年半到兩年。弗里爾把這段時程壓縮的原因歸功於自家模型,但沒有說明模型具體負責了哪些環節——是電路布局繞線、驗證,還是更前端的架構探索。
拿 Luna 跟 GLM-5.3 比價
價格的部分是這次發言中更具體的內容。弗里爾表示,Luna 降價 80% 之後,輸入價格降到每百萬 token 0.20 美元、輸出價格 1.20 美元,用量隨後成長了約 10 倍。她進一步把比較對象指向中國的開源模型:
"If you're deploying Luna and compare that to (Z.ai's) GLM 5.3, for example, on a cloud layer, we are cheaper."
如果你部署 Luna,拿它跟智譜的 GLM 5.3 在雲端層做比較,我們比較便宜。
這句話的比較基準值得留意。她比的是「部署在雲端上的 GLM-5.3」,也就是開源權重模型經第三方雲端代管後的實際單價,這跟智譜自家 API 的公開報價是不同的數字。GLM-5.3 上線時公布的輸出價格是每百萬 token 4.4 美元。同一顆模型走自家 API 還是走第三方雲端,價格可能差到好幾倍,因為後者要把 GPU 占用率、記憶體與併發使用率都攤進去。OpenAI 並未公開這次比較的完整基準,也沒說明比較時假設的吞吐量水準。
對中國開源陣營的實際壓力
這套說法瞄準的場景是企業自建部署。過去兩年,海內外企業選擇開源權重模型的主要理由有兩個:資料不用出去,以及自己算下來比較便宜。第一個理由不受影響,第二個理由正被閉源陣營的降價擠壓。當 Luna 的輸出價格壓到 1.20 美元、背後又有一顆持續降價的自研推論晶片撐腰時,「自建比較划算」這筆帳就得重新算一遍——尤其是那些併發量不高、GPU 使用率拉不上去的團隊。
必須說明的是,弗里爾給出的是賣方角度的說法,目前還沒有第三方針對 Luna 與 GLM-5.3 在相同吞吐條件下做過公開的單價核算,智譜方面也還沒有針對這項比較做出回應。
參考來源:路透社、CocoLoop、Qz;本文綜合多方報導核對 Luna 的輸入輸出單價與降價幅度、Jalapeno 的設計週期與樣品成本比例,以及弗里爾的英文發言內容。