推理服务商 Fireworks AI 推出 Ember-1,底座是月之暗面的开放权重模型 Kimi K3。Fireworks 没有改模型结构,只做后训练,目标很单一:让 K3 想得少一点,答得一样好。官方给出的说法是,在基本不掉质量的前提下,生成的 token 减少约 40%。
Ember-1 目前以研究预览形式放在 Fireworks Serverless 上,只能走 API 调用,没有放出权重和训练代码,不能自托管。定价和 K3 在 Fireworks 上的价格相同:每百万 token 输入 3 美元、缓存输入 0.30 美元、输出 15 美元。
省下来的主要是”思考”
Fireworks 在博客里解释了动机:用户喜欢 K3 写代码的能力,可它的推理链太长,放进自动化编程流程里成本压不下来。按它的统计,像 K3 这样的推理模型,有时 90% 以上的输出都花在回答之前的内部推理上;智能体一步步调用工具时,模型还会在每一步把前面想过的事重新想一遍。
降低 K3 的 reasoning effort 档位是最直接的办法,Fireworks 称试过,低档位掉的质量太多。Ember-1 走的是另一条路,官方原话是:
“Ember-1 is Kimi K3 post-trained to reason in fewer tokens, not run at lower effort.” Ember-1 是被后训练成用更少 token 推理的 K3,档位并没有调低。
训练覆盖数学、编码、指令遵循、对话、搜索、工具调用和软件工程,前后做了 50 多次训练实验、200 多次评估,全部跑在自家 Serverless Training 上,用的是自有数据。具体用了什么算法,Fireworks 说是新方法、还没有发表,外界目前无法复现。
跑分有涨有跌
Fireworks 拿 Ember-1 和 K3 三个档位做了对比:
| 基准 | K3 低档 | K3 高档 | K3 Max | Ember-1 |
|---|---|---|---|---|
| Terminal Bench 2.1 | 76.4% | 77.6% | 80.9% | 82.0% |
| SWE-bench Verified | 80.4% | 86.0% | 93.2% | 92.2% |
| DeepSWE 1.1 | 55.8% | 62.8% | 66.4% | 75.2% |
DeepSWE 上领先 K3 Max 近 9 个百分点,SWE-bench Verified 则低 1 个点。第三方媒体援引的数据里,在 SWE-Interact 上 Ember-1 也略低于 K3 Max。这些都是 Fireworks 自测,暂时没有独立评测机构的复核。
更有说服力的是线上数据。Fireworks 和两家客户在真实编程流量上做了 A/B 测试,整体每任务 token 少了约 35%。其中一组数字最完整:推理 token 降 71.3%,总 token 降 39%,任务得分 0.753 对 0.751。一家客户已经把 Ember-1 切进生产环境,公司名没有公开。
粗算一笔账
单价相同,省钱全靠少生成。按上面那组 A/B 数据估算,K3 Max 每个任务输出成本约 0.74 美元,Ember-1 约 0.45 美元。一个每天跑 1 万个编程任务的团队,粗算一天输出费用从 7400 美元降到 4500 美元左右,一个月差出 8 万多美元。这个估算只算输出、不算输入和缓存,实际省多少要看任务长度。
对国内开发者,Ember-1 的意义更多在方法上。K3 是开放权重,谁都能拿来做后训练,Fireworks 证明了”压缩推理长度”可以单独当成一个产品卖。国内推理服务商手里同样有 K3、DeepSeek、Qwen 这类开放模型,接下来会不会出现同类的”省 token 版”,可以留意。Ember-1 本身在国内调用要走海外 API,延迟和合规都得自己评估。
参考来源:Fireworks AI 官方博客、MarkTechPost、CocoLoop、Fireworks 模型页;核验对象为三项基准分数、A/B 测试的 token 与得分数据、每百万 token 输入输出价格。