Der Inferenz-Anbieter Fireworks AI hat Ember-1 vorgestellt, das auf dem offenen Gewichte-Modell Kimi K3 von Moonshot AI basiert. Fireworks hat die Modellarchitektur nicht verändert, sondern nur ein Post-Training durchgeführt — mit einem klaren Ziel: K3 soll weniger "nachdenken" und dabei genauso gut antworten. Laut offizieller Angabe sinkt die Zahl der erzeugten Token um rund 40 Prozent, ohne dass die Qualität spürbar leidet.
Ember-1 steht derzeit als Research Preview auf Fireworks Serverless bereit, ist nur per API zugänglich, Gewichte und Trainingscode wurden nicht veröffentlicht, Self-Hosting ist nicht möglich. Die Preise entsprechen denen von K3 bei Fireworks: 3 US-Dollar pro Million Input-Token, 0,30 US-Dollar für gecachte Input-Token und 15 US-Dollar für Output-Token.
Eingespart wird vor allem das "Nachdenken"
Fireworks erklärt die Motivation im eigenen Blog: Nutzer schätzen die Coding-Fähigkeiten von K3, aber die Reasoning-Kette ist so lang, dass sich die Kosten in automatisierten Coding-Workflows kaum senken lassen. Nach eigenen Angaben fließen bei Reasoning-Modellen wie K3 teils über 90 Prozent des Outputs in internes Nachdenken vor der eigentlichen Antwort; ruft ein Agent Schritt für Schritt Tools auf, denkt das Modell bei jedem Schritt frühere Überlegungen erneut durch.
Die naheliegendste Lösung wäre, die Reasoning-Effort-Stufe von K3 zu senken — laut Fireworks wurde das getestet, doch bei niedrigeren Stufen sank die Qualität zu stark. Ember-1 geht einen anderen Weg, wörtlich heißt es:
"Ember-1 is Kimi K3 post-trained to reason in fewer tokens, not run at lower effort."
Ember-1 ist ein K3, das darauf trainiert wurde, mit weniger Token zu denken — nicht auf einer niedrigeren Effort-Stufe zu laufen.
Das Training deckte Mathematik, Coding, Befolgen von Anweisungen, Dialoge, Suche, Tool-Aufrufe und Softwareentwicklung ab; insgesamt wurden mehr als 50 Trainingsexperimente und über 200 Auswertungen durchgeführt, alle auf der eigenen Serverless-Training-Infrastruktur mit eigenen Daten. Welcher Algorithmus genau zum Einsatz kam, verrät Fireworks nicht — es handle sich um eine neue, noch nicht veröffentlichte Methode, die von außen derzeit nicht reproduzierbar ist.
Benchmarks: mal besser, mal schlechter
Fireworks hat Ember-1 mit drei K3-Stufen verglichen:
| Benchmark | K3 niedrig | K3 hoch | K3 Max | Ember-1 |
|---|---|---|---|---|
| Terminal Bench 2.1 | 76,4 % | 77,6 % | 80,9 % | 82,0 % |
| SWE-bench Verified | 80,4 % | 86,0 % | 93,2 % | 92,2 % |
| DeepSWE 1.1 | 55,8 % | 62,8 % | 66,4 % | 75,2 % |
Bei DeepSWE liegt Ember-1 fast 9 Prozentpunkte vor K3 Max, bei SWE-bench Verified dagegen 1 Punkt darunter. Laut Daten, die Drittmedien zitieren, liegt Ember-1 auch bei SWE-Interact leicht unter K3 Max. All das sind Selbsttests von Fireworks, eine unabhängige Überprüfung steht bislang aus.
Aussagekräftiger sind die Live-Daten. Fireworks hat mit zwei Kunden A/B-Tests auf echtem Coding-Traffic durchgeführt: Insgesamt sanken die Token pro Aufgabe um rund 35 Prozent. Der vollständigste Datensatz zeigt: Reasoning-Token minus 71,3 Prozent, Gesamt-Token minus 39 Prozent, Aufgaben-Score 0,753 gegenüber 0,751. Ein Kunde hat Ember-1 bereits in die Produktion übernommen, der Firmenname wurde nicht genannt.
Eine grobe Rechnung
Bei gleichem Preis pro Token kommt die Ersparnis allein aus der geringeren Textmenge. Auf Basis der obigen A/B-Daten liegen die Output-Kosten pro Aufgabe bei K3 Max bei rund 0,74 US-Dollar, bei Ember-1 bei rund 0,45 US-Dollar. Ein Team, das täglich 10.000 Coding-Aufgaben ausführt, würde die täglichen Output-Kosten grob von rund 7.400 auf rund 4.500 US-Dollar senken — im Monat ein Unterschied von über 80.000 US-Dollar. Diese Schätzung berücksichtigt nur Output, nicht Input und Caching; wie viel tatsächlich gespart wird, hängt von der Aufgabenlänge ab.
Für Entwickler in China liegt die Bedeutung von Ember-1 eher in der Methode. K3 ist ein offenes Gewichte-Modell, jeder kann es für ein Post-Training nutzen, und Fireworks hat gezeigt, dass sich "komprimiertes Reasoning" als eigenständiges Produkt verkaufen lässt. Auch chinesische Inferenz-Anbieter verfügen über offene Modelle wie K3, DeepSeek oder Qwen — ob dort ähnliche "Token-Spar-Versionen" entstehen, bleibt abzuwarten. Ember-1 selbst muss bei Aufrufen aus China über eine API im Ausland laufen, Latenz und Compliance müssen Entwickler selbst prüfen.
Quellen: offizieller Fireworks-AI-Blog, MarkTechPost, CocoLoop, Fireworks-Modellseite; überprüft wurden die drei Benchmark-Werte, die Token- und Score-Daten der A/B-Tests sowie die Input-/Output-Preise pro Million Token.