FireworksがKimi K3改良、トークン4割減のEmber-1

推論サービス企業のFireworks AIが、月の暗面(Moonshot AI)のオープンウェイトモデル「Kimi K3」をベースにしたEmber-1を発表した。Fireworksはモデルの構造自体には手を加えず、事後学習(ポストトレーニング)のみを実施。狙いはただ一つ、K3に「考える量」を減らしつつ、回答の質は落とさないことだ。公式発表によれば、品質をほぼ落とさずに生成トークン数を約40%削減できるという。

Ember-1は現在、Fireworks Serverless上でリサーチプレビューとして提供されており、API経由でのみ利用できる。重みや学習コードは公開されておらず、セルフホストはできない。価格はFireworks上のK3と同じで、入力100万トークンあたり3ドル、キャッシュ入力0.30ドル、出力15ドルとなっている。

削減されているのは主に「思考」の部分

Fireworksはブログで開発の動機を説明している。ユーザーはK3のコーディング能力を評価しているが、推論チェーンが長すぎてコーディング自動化パイプラインに組み込むとコストが下がらない、という課題があった。同社の統計によれば、K3のような推論モデルは、回答を出す前の内部推論だけで出力の90%以上を占めることがあり、エージェントが段階的にツールを呼び出す場合、モデルはステップごとにそれまで考えた内容を最初から考え直してしまうという。

最も直接的な対策はK3の推論強度(reasoning effort)の設定を下げることだが、Fireworksによれば低い設定では品質の低下が大きすぎたという。Ember-1が採用したのは別の道筋だ。同社は次のように述べている。

"Ember-1 is Kimi K3 post-trained to reason in fewer tokens, not run at lower effort."

学習は数学、コーディング、指示追従、対話、検索、ツール呼び出し、ソフトウェアエンジニアリングを対象に行われ、50回を超える学習実験と200回以上の評価を、すべて自社のServerless Training基盤上で自社データを使って実施した。具体的なアルゴリズムについて、Fireworksは新しい手法で未発表としており、外部での再現は現時点ではできないとしている。

ベンチマークは上がった項目も下がった項目もある

FireworksはEmber-1とK3の3段階を比較している。

ベンチマークK3 LowK3 HighK3 MaxEmber-1
Terminal Bench 2.176.4%77.6%80.9%82.0%
SWE-bench Verified80.4%86.0%93.2%92.2%
DeepSWE 1.155.8%62.8%66.4%75.2%

DeepSWEではK3 Maxを約9ポイント上回った一方、SWE-bench Verifiedでは約1ポイント下回った。第三者メディアが引用したデータでは、SWE-InteractでもEmber-1はK3 Maxをわずかに下回っているという。これらはすべてFireworksによる自社テストであり、独立した評価機関による検証はまだ行われていない。

より説得力があるのは実運用データだ。Fireworksは2社の顧客と実際のコーディングトラフィックでA/Bテストを実施し、タスクあたりのトークン数が全体で約35%減少したという結果を得た。最も詳細なデータセットでは、推論トークンが71.3%減、総トークンが39%減、タスクスコアは0.753対0.751だった。ある顧客はすでにEmber-1を本番環境に投入しているが、社名は非公開となっている。

ざっくりとしたコスト試算

単価が同じである以上、コスト削減は生成量の減少だけによるものだ。上記のA/Bデータをもとに試算すると、K3 Maxのタスクあたり出力コストは約0.74ドル、Ember-1は約0.45ドルとなる。1日に1万件のコーディングタスクをこなすチームであれば、1日あたりの出力コストは約7400ドルから4500ドル前後に下がり、月換算では8万ドル以上の差になる計算だ。この試算は出力トークンのみを対象としており、入力やキャッシュは含まれていないため、実際の削減幅はタスクの長さに左右される。

中国国内の開発者にとって、Ember-1の意味合いはむしろ手法そのものにある。K3はオープンウェイトのため誰でも事後学習が可能で、Fireworksは「推論の長さを圧縮する」こと自体を単独の製品として売れることを示した形だ。中国国内の推論サービス企業もK3やDeepSeek、Qwenといった同様のオープンモデルを抱えており、同様の「トークン節約版」が今後登場するかどうかは注目される。Ember-1自体を中国国内から利用する場合は海外のAPIを経由する必要があり、遅延やコンプライアンスについては利用者自身が評価する必要がある。

参考資料: Fireworks AI公式ブログ、MarkTechPost、CocoLoop、Fireworksモデルページ。3項目のベンチマークスコア、A/Bテストのトークン数・スコアデータ、入出力の100万トークンあたり価格を照合した。