Fireworks AI a publié une série de données d'évaluation sur DeepSeek-V4.1-Flash dont la conclusion tient en une phrase : sur les tâches de codage en mode agent, ce modèle se situe dans la même fourchette de précision que GPT-6 Astra, pour un coût par tâche 15 fois inférieur.
D'abord les scores. Sur le pass@1 de DeepSWE, DeepSeek-V4.1-Flash atteint 74,34 %, GPT-6 Astra 74,12 %, Gemini 3.8 Flash 73,83 % et Claude Opus 5 73,65 %. Les quatre modèles se tiennent dans un écart de seulement 0,69 point de pourcentage, ce qui rend la question du premier rang peu significative. Sur Terminal-Bench 2.1, DeepSeek obtient 86,5 % contre 87,5 % pour Astra, légèrement devant.
Le calcul, en détail
Selon les chiffres de Fireworks, le coût par tâche s'établit ainsi : DeepSeek-V4.1-Flash, 0,430 dollar ; Gemini 3.8 Flash, 2,362 dollars ; GPT-6 Astra, 6,524 dollars ; Claude Opus 5, 11,838 dollars. En prenant DeepSeek comme référence, les trois autres coûtent respectivement 5,5, 15 et 28 fois plus cher.
Un calcul approximatif permet de mesurer le poids de cet écart sur un budget réel : une équipe de dix ingénieurs, chacun exécutant 20 tâches de codage en mode agent par jour, sur 22 jours ouvrés par mois, totalise 4 400 tâches. La voie DeepSeek coûte environ 1 892 dollars, la voie Astra environ 28 706 dollars, soit un écart d'environ 26 800 dollars par mois et près de 320 000 dollars par an. Il s'agit d'une estimation : la répartition réelle des tokens ne sera pas identique à celle du benchmark, mais l'ordre de grandeur devrait rester comparable.
L'écart sur HLE
Le même jeu de données révèle un écart en sens inverse. Sur Humanity's Last Exam, DeepSeek-V4.1-Flash obtient 34,52 % contre 50,40 % pour GPT-6 Astra, soit un écart de 15,88 points de pourcentage. L'égalité observée sur les tâches de codage ne se retrouve pas sur ce type de raisonnement généraliste de haut niveau.
Fireworks fournit également un indicateur baptisé Oracle Router : en combinant les deux modèles, le score théorique atteint 54,80 %. Il s'agit d'un plafond, qui suppose de savoir à l'avance à quel modèle confier chaque question. Un système de routage réel n'a pas accès à cette information ; ce chiffre montre surtout que les angles morts des deux modèles ne se recoupent pas, plutôt qu'il ne constitue une solution utilisable en pratique.
Côté architecture
Le modèle lui-même est un MoE de 552 milliards de paramètres, avec une activation distincte pour l'entrée et la sortie : 8 milliards de paramètres actifs côté entrée, 16 milliards côté sortie. Le changement sur le KV cache est plus direct : l'utilisation de HBM tombe au quart de celle de la génération précédente, et celle du SSD au huitième.
L'origine de l'avantage de coût correspond à cette couche technique. Les tâches de codage en mode agent se caractérisent par un contexte long et de nombreux tours d'échange, ce qui fait peser le coût du KV cache bien plus lourdement que pour une simple question ponctuelle. En réduisant l'empreinte mémoire et disque du cache au quart et au huitième, le fournisseur peut faire tenir davantage de requêtes simultanées sur le même matériel, ce qui permet de baisser le prix par tâche. Les 0,43 dollar ne résultent donc pas d'une simple stratégie tarifaire.
D'où viennent ces chiffres
Il faut le préciser : cette évaluation a été publiée par Fireworks AI elle-même, qui commercialise par ailleurs DeepSeek-V4.1-Flash sur sa plateforme — l'évaluateur et le vendeur ne font qu'un. DeepSeek n'a pas confirmé ces chiffres de son côté, et aucune reproduction indépendante par un tiers n'a été observée à ce jour.
Le choix des benchmarks influence également la conclusion. DeepSWE et Terminal-Bench privilégient des tâches de code à caractère plutôt technique, assez proches du développement quotidien, mais avec un autre référentiel ou une autre répartition des tâches, ces données ne permettent pas de dire si le classement relatif des quatre modèles resterait dans une fourchette de 0,69 point de pourcentage. Le ratio de coût peut être retenu ; l'ériger en classement définitif des capacités des modèles serait abusif.
Sources : blog technique de Fireworks AI, CocoLoop ; les trois scores DeepSWE, Terminal-Bench 2.1 et HLE, ainsi que le coût par tâche et les paramètres d'architecture, ont été vérifiés point par point avec le billet de blog original ; la dépense mensuelle de l'équipe de dix personnes est une estimation approximative.