Fireworks retravaille Kimi K3 et réduit les tokens de 40 %

Le fournisseur d'inférence Fireworks AI a lancé Ember-1, construit sur le modèle à poids ouverts Kimi K3 de Moonshot AI. Fireworks n'a pas modifié l'architecture du modèle, se contentant d'un post-entraînement, avec un objectif unique : faire en sorte que K3 "réfléchisse" moins tout en répondant aussi bien. Selon l'entreprise, cela réduit d'environ 40 % le nombre de tokens générés, sans perte de qualité significative.

Ember-1 est pour l'instant disponible en version de recherche préliminaire (research preview) sur Fireworks Serverless, accessible uniquement via API, sans publication des poids ni du code d'entraînement, et sans possibilité d'auto-hébergement. Le tarif est identique à celui de K3 chez Fireworks : 3 dollars par million de tokens en entrée, 0,30 dollar pour les tokens en entrée mis en cache, et 15 dollars pour les tokens en sortie.

L'économie vient surtout de la "réflexion"

Fireworks explique sa motivation dans son blog : les utilisateurs apprécient les capacités de programmation de K3, mais sa chaîne de raisonnement est trop longue, ce qui empêche de réduire les coûts dans les flux de programmation automatisés. Selon ses propres statistiques, pour des modèles de raisonnement comme K3, plus de 90 % de la sortie est parfois consacrée au raisonnement interne avant la réponse ; lorsqu'un agent appelle des outils étape par étape, le modèle "repense" à chaque étape ce qu'il avait déjà envisagé.

Réduire le niveau de reasoning effort de K3 serait la solution la plus directe, et Fireworks affirme l'avoir testée : à un niveau bas, la qualité chutait trop. Ember-1 emprunte une autre voie ; selon les propres mots de l'entreprise :

"Ember-1 is Kimi K3 post-trained to reason in fewer tokens, not run at lower effort."

Ember-1 est un K3 post-entraîné pour raisonner avec moins de tokens, et non pour fonctionner à un niveau d'effort réduit.

L'entraînement a couvert les mathématiques, la programmation, le respect des instructions, le dialogue, la recherche, l'appel d'outils et l'ingénierie logicielle, avec plus de 50 expériences d'entraînement et plus de 200 évaluations, le tout exécuté sur sa propre infrastructure Serverless Training et avec des données propriétaires. Quant à l'algorithme exact utilisé, Fireworks indique seulement qu'il s'agit d'une méthode nouvelle, non encore publiée, donc impossible à reproduire de l'extérieur pour l'instant.

Des scores en hausse comme en baisse

Fireworks a comparé Ember-1 à trois niveaux de K3 :

BenchmarkK3 basK3 élevéK3 MaxEmber-1
Terminal Bench 2.176,4 %77,6 %80,9 %82,0 %
SWE-bench Verified80,4 %86,0 %93,2 %92,2 %
DeepSWE 1.155,8 %62,8 %66,4 %75,2 %

Sur DeepSWE, Ember-1 devance K3 Max de près de 9 points de pourcentage, mais sur SWE-bench Verified, il accuse 1 point de retard. Selon des données citées par des médias tiers, sur SWE-Interact, Ember-1 est également légèrement en dessous de K3 Max. Il s'agit à chaque fois de tests internes réalisés par Fireworks, sans vérification par un organisme d'évaluation indépendant pour l'instant.

Les données de production sont plus convaincantes. Fireworks a mené des tests A/B avec deux clients sur du trafic de programmation réel, avec une baisse globale d'environ 35 % du nombre de tokens par tâche. L'ensemble de données le plus complet montre : les tokens de raisonnement en baisse de 71,3 %, les tokens totaux en baisse de 39 %, un score de tâche de 0,753 contre 0,751. Un client a déjà déployé Ember-1 en production ; le nom de l'entreprise n'a pas été communiqué.

Un calcul rapide

Le prix par token étant identique, l'économie vient entièrement de la réduction du texte généré. Sur la base de ces données A/B, le coût de sortie par tâche s'élève à environ 0,74 dollar pour K3 Max, contre environ 0,45 dollar pour Ember-1. Pour une équipe exécutant 10 000 tâches de programmation par jour, le coût de sortie quotidien passerait d'environ 7 400 à environ 4 500 dollars, soit un écart de plus de 80 000 dollars par mois. Cette estimation ne porte que sur la sortie, sans compter l'entrée ni le cache ; l'économie réelle dépend de la longueur des tâches.

Pour les développeurs chinois, l'intérêt d'Ember-1 tient surtout à la méthode. K3 est un modèle à poids ouverts que n'importe qui peut post-entraîner, et Fireworks a démontré que "compresser la longueur du raisonnement" pouvait devenir un produit à part entière. Les fournisseurs d'inférence chinois disposent eux aussi de modèles ouverts comme K3, DeepSeek ou Qwen ; reste à voir si des "versions économes en tokens" similaires apparaîtront. Ember-1 lui-même, utilisé depuis la Chine, doit transiter par une API à l'étranger, ce qui impose d'évaluer séparément la latence et la conformité réglementaire.

Sources : blog officiel de Fireworks AI, MarkTechPost, CocoLoop, page des modèles Fireworks ; éléments vérifiés : les trois scores de benchmark, les données de tokens et de score des tests A/B, ainsi que les prix des tokens en entrée/sortie par million.