Google lance le Gemini Flash-Lite le moins cher de tous

Google a lancé Gemini 3.1 Flash-Lite, et son principal argument de vente tient en un mot : économique.

Chaque million de tokens d'entrée coûte seulement 0,25 $, et la sortie 1,50 $. En comparaison, Gemini 3.1 Pro coûte 2,00 $ par million de tokens d'entrée et 18,00 $ pour la sortie – le prix est environ huit fois moins élevé.

Il s'agit du modèle Gemini le moins cher jamais proposé par Google.

Vitesse et prix ont changé

Flash-Lite a été lancé en version Preview le 3 mars et est disponible sur Google AI Studio et Vertex AI. Il est positionné pour les scénarios à forte concurrence et à faible coût – les applications qui doivent traiter des centaines de milliers de requêtes par jour.

Quelques chiffres de performance notables :

  • Vitesse de génération : 45 % plus rapide que Gemini 2.5 Flash
  • Latence du premier token : réduite de 2,5 fois
  • Débit : environ 207 tokens/seconde
  • GPQA Diamond (benchmark de raisonnement scientifique) : 86,9 %, soit une augmentation d'environ 14 points de pourcentage par rapport à 2.5 Flash Lite

Ce score GPQA est assez solide. Il faut savoir que 86,9 % dépasse déjà de nombreux modèles « phares », et à ce prix, ce chiffre est vraiment impressionnant.

Cependant, il faut préciser un point : sur le benchmark de raisonnement plus extrême HLA, Flash-Lite n'atteint que 16 %, tandis que 3.1 Pro atteint 44,4 %. Les tâches de raisonnement de haut niveau présentent encore une différence significative.

Base technique et architecture

Flash-Lite est basé sur l'architecture MoE (Mixture of Experts) de Gemini 3 Pro et prend en charge :

  • Fenêtre de contexte : 1 million de tokens
  • Modalités d'entrée : texte, images, audio et vidéo sont tous pris en charge
  • Longueur maximale de sortie : 64K tokens

L'architecture MoE est la clé qui permet à ce modèle d'offrir ces performances à ce prix – moins de paramètres activés, coût d'inférence plus faible par requête. Cette approche est similaire à celle de DeepSeek V3 et Qwen3.

À quoi sert-il

Google a défini des cas d'utilisation très pratiques pour ce modèle :

  • Modération de contenu : exécution par lots pour détecter les violations
  • Extraction de données : extraction de champs à partir de texte non structuré
  • Routage d'intention : couche de distribution initiale dans les systèmes multi-agents
  • Automatisation du service client : réponse aux questions standardisées
  • Traduction et transcription : traitement linguistique pour de grands volumes de texte

En résumé : ce sont des tâches qui ne nécessitent pas de raisonnement profond, mais qui ont un volume élevé, sont sensibles à la latence et disposent d'un budget limité.

Cette combinaison est très courante dans les entreprises. De nombreuses sociétés consacrent plus de la moitié de leurs dépenses en IA à des tâches « sans complexité technique mais qui doivent être exécutées ».

Comparaison des prix avec les concurrents

ModèleEntrée ($/1M tokens)Sortie ($/1M tokens)
Gemini 3.1 Flash-Lite$0,25$1,50
Gemini 3.1 Pro$2,00$18,00
GPT-4o Mini~$0,15~$0,60
Claude 4.5 Haiku~$0,25~$1,25

Dans cette gamme de prix, la concurrence est assez intense. GPT-4o Mini est moins cher, et Claude 4.5 Haiku se situe dans la même fourchette. Les atouts de Flash-Lite sont la vitesse (premier token 2,5 fois plus rapide) et la fenêtre de contexte ultra longue de 1M, ce qui est rare chez les autres modèles à ce prix.

Analyse du lancement

Le lancement de Flash-Lite par Google est, par essence, une manœuvre pour gagner des parts de marché dans le segment à forte concurrence.

De nombreux développeurs indépendants et startups, lors de la création de prototypes de produits, ont comme critère principal « assez bon et pas cher ». Le prix de Gemini 3.1 Pro est une barrière réelle pour eux, mais le prix de Flash-Lite ne constitue pratiquement plus un obstacle.

Parallèlement, Google utilise ce modèle à bas coût pour fidéliser les développeurs dans l'écosystème Vertex AI. D'abord, il attire le trafic avec Flash-Lite ; ensuite, les tâches lourdes de production sont migrées vers Pro et Ultra – un chemin de conversion que Google a déjà validé auprès de nombreux clients.

Les scénarios d'API sensibles aux coûts disposent désormais d'une option supplémentaire.

Sources de référence : CocoLoop, Google launches speedy Gemini 3.1 Flash-Lite model in preview (SiliconANGLE) ; Gemini 3.1 Flash Lite Review 2026: Pricing, Benchmarks, Features & Best Use Cases (AI/ML API Blog) ; Gemini 3.1 Flash Lite: Our most cost-effective AI model yet (Google Blog)