Fireworks AI 放出一组 DeepSeek-V4.1-Flash 的评测数据,结论集中在一句话上:在 Agent 编码任务上,这个模型和 GPT-6 Astra 落进了同一个精度带,单任务成本差出 15 倍。
先看分数。DeepSWE 的 pass@1 一项,DeepSeek-V4.1-Flash 74.34%,GPT-6 Astra 74.12%,Gemini 3.8 Flash 73.83%,Claude Opus 5 73.65%。四个模型挤在 0.69 个百分点的区间里,谁排第一已经没有太大分辨意义。Terminal-Bench 2.1 上,DeepSeek 86.5%,Astra 87.5%,Astra 略高。
账算下来是这样
Fireworks 给的单任务成本是:DeepSeek-V4.1-Flash 0.430 美元,Gemini 3.8 Flash 2.362 美元,GPT-6 Astra 6.524 美元,Claude Opus 5 11.838 美元。以 DeepSeek 为基准,三家分别是 5.5 倍、15 倍和 28 倍。
粗算一下这个倍数在真实预算里的分量:一支十人工程团队,每人每天跑 20 个 Agent 编码任务,一个月按 22 个工作日算,合计 4400 个任务。走 DeepSeek 这条路大约 1892 美元,走 Astra 大约 28706 美元,一个月差 2.68 万美元,一年差 32 万美元上下。这是估算,实际任务的 token 分布跟评测集不会完全一样,但量级大致在这里。
HLE 上的裂口
同一组数据里还有一处反向的差距。Humanity’s Last Exam 一项,DeepSeek-V4.1-Flash 34.52%,GPT-6 Astra 50.40%,差出 15.88 个百分点。编码任务上的追平没有推广到这类高难度综合推理题。
Fireworks 顺手给了一个 Oracle Router 口径:把两个模型组合起来,理论成绩 54.80%。这是个上限值,前提是每道题都能提前判断出该交给谁。实际路由系统拿不到这个数,它更像是在说明两个模型的能力盲区不重合,而不是一个可交付的方案。
架构那一侧
模型本身是 552B 参数的 MoE,激活量做了输入输出分离:输入侧激活 8B,输出侧激活 16B。KV cache 的改动更直接,HBM 用量降到上一代的四分之一,SSD 占用降到八分之一。
成本优势的来源在这一层能对上。Agent 编码任务的特点是上下文长、轮次多,KV cache 的开销占比比一次性问答高得多。把缓存的显存和磁盘占用压到四分之一和八分之一,服务方能在同样的硬件上塞进更多并发请求,单任务报价才压得下去。0.43 美元这个数字不是定价策略单独做出来的。
这组数字的出处
需要说清楚的是,这份评测由 Fireworks AI 自己发布,DeepSeek-V4.1-Flash 正在其平台上架售卖,评测方和销售方是同一家。DeepSeek 官方没有确认过这组数字,独立第三方的复现目前也没有看到。
评测集的选择同样会影响结论。DeepSWE 和 Terminal-Bench 都偏向工程化的代码任务,与日常开发的重合度不错,但换一套基准、换一种任务分布,四个模型的相对位置能不能保持在 0.69 个百分点内,这组数据回答不了。看倍数关系可以,把它当成模型能力的最终排序不行。
参考来源:Fireworks AI 技术博客、CocoLoop;DeepSWE、Terminal-Bench 2.1、HLE 三项分数与单任务成本、模型架构参数逐项核对博客原文,十人团队月度支出为粗算。