推論服務商Fireworks AI推出Ember-1,底層是月之暗面(Moonshot AI)的開放權重模型Kimi K3。Fireworks並未更動模型架構,只做了事後訓練,目標很單純:讓K3想得少一點,答案品質卻不打折。官方說法是,在幾乎不影響品質的前提下,生成的token數量減少了約40%。
Ember-1目前以研究預覽形式上架Fireworks Serverless,只能透過API呼叫,沒有釋出權重與訓練程式碼,無法自行架設。定價與Fireworks上的K3相同:輸入每百萬token 3美元、快取輸入0.30美元、輸出15美元。
省下來的主要是「思考」過程
Fireworks在部落格文章中解釋了背後動機:使用者喜歡K3的程式撰寫能力,但它的推理鏈太長,放進自動化開發流程裡成本壓不下來。根據官方統計,像K3這類推理模型,有時超過90%的輸出都花在回答前的內部推理上;當智慧代理逐步呼叫工具時,模型還會在每一步把先前想過的內容重新想一遍。
最直接的做法是調降K3的推理強度(reasoning effort)等級,Fireworks表示試過,但低檔位掉的品質太多。Ember-1走的是另一條路,官方原話是:
"Ember-1 is Kimi K3 post-trained to reason in fewer tokens, not run at lower effort."
訓練涵蓋數學、程式撰寫、指令遵循、對話、搜尋、工具呼叫與軟體工程,前後做了50多次訓練實驗、200多次評估,全都跑在自家的Serverless Training平台上,使用自有資料。至於具體演算法,Fireworks表示是全新方法、尚未發表,外界目前無法重現。
跑分有升有降
Fireworks拿Ember-1和K3的三個檔位做了比較:
| 基準測試 | K3 Low | K3 High | K3 Max | Ember-1 |
|---|---|---|---|---|
| Terminal Bench 2.1 | 76.4% | 77.6% | 80.9% | 82.0% |
| SWE-bench Verified | 80.4% | 86.0% | 93.2% | 92.2% |
| DeepSWE 1.1 | 55.8% | 62.8% | 66.4% | 75.2% |
DeepSWE上領先K3 Max近9個百分點,SWE-bench Verified則低了約1個百分點。第三方媒體引用的數據顯示,SWE-Interact上Ember-1同樣略低於K3 Max。這些都是Fireworks自行測試的結果,目前尚未有獨立評測機構複核。
更具說服力的是實際上線數據。Fireworks與兩家客戶在真實程式開發流量上做了A/B測試,整體每個任務的token數平均少了約35%。其中一組數據最完整:推理token降71.3%,總token降39%,任務得分0.753比0.751。已有一家客戶把Ember-1切進生產環境,公司名稱未公開。
粗略算一筆帳
單價相同,省下的成本完全來自產出量減少。根據上述A/B數據估算,K3 Max每個任務的輸出成本約0.74美元,Ember-1約0.45美元。一個每天跑1萬個程式任務的團隊,粗估一天的輸出費用會從約7400美元降到4500美元左右,一個月能省下8萬多美元。這項估算只算輸出、不含輸入與快取,實際省多少要看任務長度而定。
對中國的開發者來說,Ember-1的意義更多在於方法上。K3是開放權重模型,任何人都能拿來做事後訓練,Fireworks證明了「壓縮推理長度」本身可以當成獨立產品來賣。中國國內的推論服務商手上同樣握有K3、DeepSeek、Qwen這類開放模型,接下來會不會出現同類的「省token版」值得留意。Ember-1本身在中國要呼叫需經由海外API,延遲與合規都得自行評估。
參考來源:Fireworks AI官方部落格、MarkTechPost、CocoLoop、Fireworks模型頁面;核實對象為三項基準測試分數、A/B測試的token與得分數據、每百萬token輸入輸出價格。