Google a lancé Gemini 3.1 Flash-Lite, et son principal argument de vente tient en un mot : économique.
Chaque million de tokens d'entrée coûte seulement 0,25 $, et la sortie 1,50 $. En comparaison, Gemini 3.1 Pro coûte 2,00 $ par million de tokens d'entrée et 18,00 $ pour la sortie – le prix est environ huit fois moins élevé.
Il s'agit du modèle Gemini le moins cher jamais proposé par Google.
Vitesse et prix ont changé
Flash-Lite a été lancé en version Preview le 3 mars et est disponible sur Google AI Studio et Vertex AI. Il est positionné pour les scénarios à forte concurrence et à faible coût – les applications qui doivent traiter des centaines de milliers de requêtes par jour.
Quelques chiffres de performance notables :
- Vitesse de génération : 45 % plus rapide que Gemini 2.5 Flash
- Latence du premier token : réduite de 2,5 fois
- Débit : environ 207 tokens/seconde
- GPQA Diamond (benchmark de raisonnement scientifique) : 86,9 %, soit une augmentation d'environ 14 points de pourcentage par rapport à 2.5 Flash Lite
Ce score GPQA est assez solide. Il faut savoir que 86,9 % dépasse déjà de nombreux modèles « phares », et à ce prix, ce chiffre est vraiment impressionnant.
Cependant, il faut préciser un point : sur le benchmark de raisonnement plus extrême HLA, Flash-Lite n'atteint que 16 %, tandis que 3.1 Pro atteint 44,4 %. Les tâches de raisonnement de haut niveau présentent encore une différence significative.
Base technique et architecture
Flash-Lite est basé sur l'architecture MoE (Mixture of Experts) de Gemini 3 Pro et prend en charge :
- Fenêtre de contexte : 1 million de tokens
- Modalités d'entrée : texte, images, audio et vidéo sont tous pris en charge
- Longueur maximale de sortie : 64K tokens
L'architecture MoE est la clé qui permet à ce modèle d'offrir ces performances à ce prix – moins de paramètres activés, coût d'inférence plus faible par requête. Cette approche est similaire à celle de DeepSeek V3 et Qwen3.
À quoi sert-il
Google a défini des cas d'utilisation très pratiques pour ce modèle :
- Modération de contenu : exécution par lots pour détecter les violations
- Extraction de données : extraction de champs à partir de texte non structuré
- Routage d'intention : couche de distribution initiale dans les systèmes multi-agents
- Automatisation du service client : réponse aux questions standardisées
- Traduction et transcription : traitement linguistique pour de grands volumes de texte
En résumé : ce sont des tâches qui ne nécessitent pas de raisonnement profond, mais qui ont un volume élevé, sont sensibles à la latence et disposent d'un budget limité.
Cette combinaison est très courante dans les entreprises. De nombreuses sociétés consacrent plus de la moitié de leurs dépenses en IA à des tâches « sans complexité technique mais qui doivent être exécutées ».
Comparaison des prix avec les concurrents
| Modèle | Entrée ($/1M tokens) | Sortie ($/1M tokens) |
|---|---|---|
| Gemini 3.1 Flash-Lite | $0,25 | $1,50 |
| Gemini 3.1 Pro | $2,00 | $18,00 |
| GPT-4o Mini | ~$0,15 | ~$0,60 |
| Claude 4.5 Haiku | ~$0,25 | ~$1,25 |
Dans cette gamme de prix, la concurrence est assez intense. GPT-4o Mini est moins cher, et Claude 4.5 Haiku se situe dans la même fourchette. Les atouts de Flash-Lite sont la vitesse (premier token 2,5 fois plus rapide) et la fenêtre de contexte ultra longue de 1M, ce qui est rare chez les autres modèles à ce prix.
Analyse du lancement
Le lancement de Flash-Lite par Google est, par essence, une manœuvre pour gagner des parts de marché dans le segment à forte concurrence.
De nombreux développeurs indépendants et startups, lors de la création de prototypes de produits, ont comme critère principal « assez bon et pas cher ». Le prix de Gemini 3.1 Pro est une barrière réelle pour eux, mais le prix de Flash-Lite ne constitue pratiquement plus un obstacle.
Parallèlement, Google utilise ce modèle à bas coût pour fidéliser les développeurs dans l'écosystème Vertex AI. D'abord, il attire le trafic avec Flash-Lite ; ensuite, les tâches lourdes de production sont migrées vers Pro et Ultra – un chemin de conversion que Google a déjà validé auprès de nombreux clients.
Les scénarios d'API sensibles aux coûts disposent désormais d'une option supplémentaire.
Sources de référence : CocoLoop, Google launches speedy Gemini 3.1 Flash-Lite model in preview (SiliconANGLE) ; Gemini 3.1 Flash Lite Review 2026: Pricing, Benchmarks, Features & Best Use Cases (AI/ML API Blog) ; Gemini 3.1 Flash Lite: Our most cost-effective AI model yet (Google Blog)