DeepSeek編碼追平Astra成本僅1/15

Fireworks AI公布一組DeepSeek-V4.1-Flash的測試數據,結論濃縮成一句話:在Agent編碼任務上,這款模型與GPT-6 Astra落在同一個準確度區間,但單次任務成本卻相差15倍。

先看分數。DeepSWE的pass@1項目,DeepSeek-V4.1-Flash為74.34%,GPT-6 Astra為74.12%,Gemini 3.8 Flash為73.83%,Claude Opus 5為73.65%。四款模型全部擠在0.69個百分點的區間內,誰排第一已經沒有太大意義。Terminal-Bench 2.1上,DeepSeek為86.5%,Astra為87.5%,Astra略勝一籌。

把成本算清楚

Fireworks給出的單次任務成本是:DeepSeek-V4.1-Flash為0.430美元,Gemini 3.8 Flash為2.362美元,GPT-6 Astra為6.524美元,Claude Opus 5為11.838美元。以DeepSeek為基準,其餘三款分別貴5.5倍、15倍和28倍。

把這個倍數換算成真實預算來看。假設一支十人工程團隊,每人每天跑20個Agent編碼任務,每月以22個工作天計算,總計4400個任務。走DeepSeek這條路大約要價1892美元,走Astra路線則約28706美元,一個月差了約2萬6800美元,一年下來差距落在32萬美元左右。這只是粗估,實際任務的token分佈不會跟測試集完全一樣,但數量級大致就是這樣。

HLE上出現反向缺口

同一組數據裡還有一項反過來的差距。在Humanity's Last Exam項目,DeepSeek-V4.1-Flash拿到34.52%,GPT-6 Astra則是50.40%,相差15.88個百分點。編碼任務上追平的表現,並沒有延伸到這類高難度綜合推理題上。

Fireworks也順帶給出一個Oracle Router口徑:把兩款模型組合起來,理論成績可以達到54.80%。這是一個上限值,前提是每一題都能事先判斷該交給哪個模型處理。實際的路由系統拿不到這種資訊,這個數字更像是在說明兩款模型的能力盲點沒有重疊,而不是一套可以直接部署的方案。

架構那一側

模型本身是552B參數的MoE架構,輸入端與輸出端的激活量做了分離:輸入端激活8B,輸出端激活16B。KV cache的改動更為直接,HBM用量降到上一代的四分之一,SSD佔用則降到八分之一。

成本優勢的來源就在這裡對上了。Agent編碼任務的特點是上下文長、輪次多,KV cache的開銷佔比遠比一次性問答來得高。把快取的顯示記憶體與磁碟佔用壓到四分之一與八分之一,服務端就能在同樣硬體上塞進更多並發請求,單次任務0.43美元這個數字才壓得下來,不是單靠訂價策略做出來的。

這組數字從哪裡來

有一點必須說清楚:這份測試是Fireworks AI自己發布的,而DeepSeek-V4.1-Flash正在其平台上架銷售,測試方與銷售方是同一家公司。DeepSeek官方並未證實這組數字,目前也還沒看到獨立第三方的重現結果。

測試集的選擇同樣會左右結論。DeepSWE與Terminal-Bench 2.1都偏向工程化的程式任務,與日常開發工作的重疊度不錯,但換一套基準或換一種任務分佈,四款模型的相對位置能不能維持在0.69個百分點以內,這組數據回答不了。把它看成成本倍數關係沒問題,拿來當作模型能力的最終排名就有問題了。

參考來源:Fireworks AI技術部落格、CocoLoop;DeepSWE、Terminal-Bench 2.1、HLE三項分數與單次任務成本、模型架構參數已逐項核對部落格原文,十人團隊的月度支出為粗估數字。