Google DeepMind a lancé Gemini 3.8 Flash le 2 septembre. Selon la fiche technique officielle (model card), le modèle s'appuie sur 3.7 Flash, avec des améliorations centrées sur l'ingénierie logicielle et les flux de travail de connaissance de type agent. Le lancement intervient seulement quelques jours après la fuite d'une version de test interne réservée aux employés.
Les spécifications n'ont guère changé : la fenêtre de contexte en entrée atteint 1 million de tokens, la limite de sortie par tour est de 64 000 tokens, les connaissances vont jusqu'à mars 2026, certains domaines restant toutefois arrêtés à janvier 2025. La diffusion s'est faite d'un coup sur tous les canaux : l'application Gemini, AI Studio, l'API Gemini, la Gemini Enterprise Agent Platform, le Google AI Mode et l'outil de programmation Antigravity. Le modèle prend en charge des niveaux d'effort réglables, permettant aux développeurs d'arbitrer eux-mêmes entre qualité, coût et latence.
Deux visages dans le même tableau
Le tableau comparatif officiel place 3.8 Flash aux côtés de 3.7 Flash, Claude Opus 5, Claude Sonnet 5, GPT-5.6 Sol et GPT-5.6 Terra ; ce qui frappe, c'est le décalage entre le prix et les scores.
3.8 Flash conserve son tarif promotionnel de 0,75 dollar par million de tokens en entrée et 3,75 dollars en sortie ; Claude Opus 5 coûte 5 et 25 dollars, soit plus de six fois plus. Avec cet écart de prix, les deux modèles obtiennent 89,4 contre 89,1 sur Terminal-bench 2.1, quasiment à égalité ; sur CharXiv Reasoning, c'est 86,2 contre 83,7, sur HLE-Verified 54,9 contre 54,4, sur la tâche d'analyse financière 61,4 contre 58,6, sur le flux juridique Harvey 10,0 contre 6,7 — dans tous ces cas, 3.8 Flash est devant ; sur la compréhension de vidéos longues, l'écart se creuse davantage, 87,8 contre 75,4.
Dès que la tâche s'allonge, la tendance s'inverse. Sur Terminal-bench 4.0, qui évalue des capacités d'agent plus générales, Opus 5 obtient 51,8 contre seulement 19,1 pour 3.8 Flash ; sur OSWorld-2.0, qui mesure la manipulation d'un ordinateur par un agent, c'est 75,4 contre 59,0 ; sur le score Elo de GDPVal-AA v2, qui mesure le travail de connaissance, 1824 contre 1545. Sur des tâches d'ingénierie logicielle à cycle long comme DeepSWE, le résultat est de 74,0 contre 71,0 — l'écart est plus modeste mais va dans le même sens.
La logique est assez claire : plus une tâche est courte et proche d'un jugement en un seul tour, moins le niveau de prix pèse ; plus elle est longue, et plus le modèle doit maintenir son propre état et s'autocorriger, plus l'écart entre niveaux de prix se rouvre. À vue de nez, pour mener à bien le même pipeline de code de complexité moyenne, le coût d'inférence de 3.8 Flash représente environ un sixième de celui d'Opus 5, pour un écart de résultat inférieur à un point de pourcentage ; mais pour un flux d'agent nécessitant des dizaines d'étapes consécutives, seule la pratique dira combien de ces économies sont mangées par les nouvelles tentatives après un échec.
Le progrès par rapport à 3.7 Flash, lui, est bien réel. DeepSWE passe de 65,3 à 71,0, Terminal-bench 4.0 de 11,2 à 19,1, OSWorld de 50,6 à 59,0, et le niveau difficile des flux de recherche biologique bondit de 43,4 à 56,5. Avec un rythme de sortie de quelques semaines, ce gain n'a rien de négligeable.
Les utilisateurs l'ont su avant l'annonce
Avant même la mise en ligne de la fiche technique officielle, la communauté des développeurs avait déjà remarqué quelque chose d'anormal : sur la version web et dans Antigravity, le modèle affichait toujours l'étiquette 3.7 Flash, mais répondait « je suis 3.8 Flash » quand on lui demandait quel modèle il était. D'autres utilisateurs, en pleine session, ont vu apparaître d'un coup une nouvelle ligne « 3.8 Flash » dans le sélecteur de modèle, avec le niveau d'effort réglé par défaut sur High.
Changer de modèle en silence est une pratique courante chez les laboratoires de pointe : cela permet de le tester en charge réelle et de revenir en arrière au moindre problème. Le coût retombe sur les utilisateurs : le comportement sous un même nom de modèle change à un moment donné, l'efficacité des prompts, la consommation de tokens et le style de sortie peuvent évoluer avec lui, sans que cela figure généralement dans un quelconque journal des modifications. Pour les équipes facturées au token, les variations de facture arrivent souvent avant l'annonce officielle elle-même.
Les premiers tests de la communauté ont suivi les méthodes habituelles : demander au modèle de générer en une fois une animation du système solaire, ou de dessiner un SVG de pélican. Ce genre de test n'a rien de scientifique, mais a l'avantage d'être accessible — le bon ou le mauvais résultat saute aux yeux — et reste souvent la seule référence disponible avant la publication des scores officiels. Les avis ne sont pas unanimes non plus, certains saluent, d'autres critiquent, comme à chaque mise à jour de modèle.
Le bas prix a une date d'expiration
La fiche technique liste quelques limites connues : des réponses occasionnellement lentes et des délais d'attente persistent ; lorsque le niveau d'effort est augmenté, le modèle consomme davantage de tokens pour améliorer ses performances, si bien que le coût réel ne suit pas forcément le prix affiché de manière linéaire. Côté sécurité, l'entreprise indique un niveau globalement équivalent à 3.7 Flash, une équipe de red team humaine ayant confirmé que le seuil de sécurité pour les enfants était atteint pour le lancement, tandis que les indicateurs de sécurité pour les scénarios non anglophones ont légèrement reculé.
Sous la colonne des prix figure encore une petite note : les tarifs promotionnels de 3.7 et 3.8 Flash prennent fin le 31 décembre, et repasseront dès le 1er janvier suivant à 1,5 dollar par million de tokens en entrée et 7,5 dollars en sortie — exactement le double. Ce tableau rapport qualité-prix devra être recalculé dans quatre mois.
Sources : fiche technique de Google DeepMind, CocoLoop, tableau comparatif officiel des performances de Google, discussions de la communauté des développeurs ; la longueur du contexte, la limite de sortie, la date de coupure des connaissances et les canaux de diffusion ont été vérifiés dans la fiche technique, les scores de référence et le prix par million de tokens proviennent du tableau comparatif officiel.