Fireworks passt Kimi K3 an: 40 Prozent weniger Token

Der Inferenz-Anbieter Fireworks AI hat Ember-1 vorgestellt, das auf dem offenen Gewichte-Modell Kimi K3 von Moonshot AI basiert. Fireworks hat die Modellarchitektur nicht verändert, sondern nur ein Post-Training durchgeführt — mit einem klaren Ziel: K3 soll weniger "nachdenken" und dabei genauso gut antworten. Laut offizieller Angabe sinkt die Zahl der erzeugten Token um rund 40 Prozent, ohne dass die Qualität spürbar leidet.

Ember-1 steht derzeit als Research Preview auf Fireworks Serverless bereit, ist nur per API zugänglich, Gewichte und Trainingscode wurden nicht veröffentlicht, Self-Hosting ist nicht möglich. Die Preise entsprechen denen von K3 bei Fireworks: 3 US-Dollar pro Million Input-Token, 0,30 US-Dollar für gecachte Input-Token und 15 US-Dollar für Output-Token.

Eingespart wird vor allem das "Nachdenken"

Fireworks erklärt die Motivation im eigenen Blog: Nutzer schätzen die Coding-Fähigkeiten von K3, aber die Reasoning-Kette ist so lang, dass sich die Kosten in automatisierten Coding-Workflows kaum senken lassen. Nach eigenen Angaben fließen bei Reasoning-Modellen wie K3 teils über 90 Prozent des Outputs in internes Nachdenken vor der eigentlichen Antwort; ruft ein Agent Schritt für Schritt Tools auf, denkt das Modell bei jedem Schritt frühere Überlegungen erneut durch.

Die naheliegendste Lösung wäre, die Reasoning-Effort-Stufe von K3 zu senken — laut Fireworks wurde das getestet, doch bei niedrigeren Stufen sank die Qualität zu stark. Ember-1 geht einen anderen Weg, wörtlich heißt es:

"Ember-1 is Kimi K3 post-trained to reason in fewer tokens, not run at lower effort."

Ember-1 ist ein K3, das darauf trainiert wurde, mit weniger Token zu denken — nicht auf einer niedrigeren Effort-Stufe zu laufen.

Das Training deckte Mathematik, Coding, Befolgen von Anweisungen, Dialoge, Suche, Tool-Aufrufe und Softwareentwicklung ab; insgesamt wurden mehr als 50 Trainingsexperimente und über 200 Auswertungen durchgeführt, alle auf der eigenen Serverless-Training-Infrastruktur mit eigenen Daten. Welcher Algorithmus genau zum Einsatz kam, verrät Fireworks nicht — es handle sich um eine neue, noch nicht veröffentlichte Methode, die von außen derzeit nicht reproduzierbar ist.

Benchmarks: mal besser, mal schlechter

Fireworks hat Ember-1 mit drei K3-Stufen verglichen:

BenchmarkK3 niedrigK3 hochK3 MaxEmber-1
Terminal Bench 2.176,4 %77,6 %80,9 %82,0 %
SWE-bench Verified80,4 %86,0 %93,2 %92,2 %
DeepSWE 1.155,8 %62,8 %66,4 %75,2 %

Bei DeepSWE liegt Ember-1 fast 9 Prozentpunkte vor K3 Max, bei SWE-bench Verified dagegen 1 Punkt darunter. Laut Daten, die Drittmedien zitieren, liegt Ember-1 auch bei SWE-Interact leicht unter K3 Max. All das sind Selbsttests von Fireworks, eine unabhängige Überprüfung steht bislang aus.

Aussagekräftiger sind die Live-Daten. Fireworks hat mit zwei Kunden A/B-Tests auf echtem Coding-Traffic durchgeführt: Insgesamt sanken die Token pro Aufgabe um rund 35 Prozent. Der vollständigste Datensatz zeigt: Reasoning-Token minus 71,3 Prozent, Gesamt-Token minus 39 Prozent, Aufgaben-Score 0,753 gegenüber 0,751. Ein Kunde hat Ember-1 bereits in die Produktion übernommen, der Firmenname wurde nicht genannt.

Eine grobe Rechnung

Bei gleichem Preis pro Token kommt die Ersparnis allein aus der geringeren Textmenge. Auf Basis der obigen A/B-Daten liegen die Output-Kosten pro Aufgabe bei K3 Max bei rund 0,74 US-Dollar, bei Ember-1 bei rund 0,45 US-Dollar. Ein Team, das täglich 10.000 Coding-Aufgaben ausführt, würde die täglichen Output-Kosten grob von rund 7.400 auf rund 4.500 US-Dollar senken — im Monat ein Unterschied von über 80.000 US-Dollar. Diese Schätzung berücksichtigt nur Output, nicht Input und Caching; wie viel tatsächlich gespart wird, hängt von der Aufgabenlänge ab.

Für Entwickler in China liegt die Bedeutung von Ember-1 eher in der Methode. K3 ist ein offenes Gewichte-Modell, jeder kann es für ein Post-Training nutzen, und Fireworks hat gezeigt, dass sich "komprimiertes Reasoning" als eigenständiges Produkt verkaufen lässt. Auch chinesische Inferenz-Anbieter verfügen über offene Modelle wie K3, DeepSeek oder Qwen — ob dort ähnliche "Token-Spar-Versionen" entstehen, bleibt abzuwarten. Ember-1 selbst muss bei Aufrufen aus China über eine API im Ausland laufen, Latenz und Compliance müssen Entwickler selbst prüfen.

Quellen: offizieller Fireworks-AI-Blog, MarkTechPost, CocoLoop, Fireworks-Modellseite; überprüft wurden die drei Benchmark-Werte, die Token- und Score-Daten der A/B-Tests sowie die Input-/Output-Preise pro Million Token.