Google pousse Flash vers la bataille des coûts

Google a présenté trois modèles Flash le 21 juillet. À première vue, c'est une mise à jour de Gemini. En regardant le prix, la vitesse et l'usage visé, le message est plus net: Google veut rendre l'IA agentique et d'entreprise moins chère, plus rapide et mieux adaptée à chaque charge de travail.

Gemini 3.6 Flash joue le rôle de modèle général, Gemini 3.5 Flash-Lite vise le faible coût et le fort débit, et Gemini 3.5 Flash Cyber cible la sécurité. La concurrence se déplace d'un seul classement vers la conception par workload.

Les appels fréquents ont besoin de modèles bon marché

Google indique que le nouveau Flash-Lite produit en temps réel 17% plus vite que la génération précédente et atteint environ 350 tokens/s dans des tests indépendants. La page DeepMind liste un prix de 0,30 dollar par million de tokens d'entrée et 2,50 dollars par million de tokens de sortie.

Pour un chat classique, la qualité de réponse saute aux yeux. Pour des agents, du support client, de l'automatisation de navigateur ou du traitement massif de documents, des centaines de petits appels doivent rester dans les limites de latence et de budget.

La sécurité devient un modèle séparé

Flash Cyber est la partie la plus ciblée de l'annonce. Google le destine à l'analyse de sécurité, à la recherche de vulnérabilités, à l'analyse de logiciels malveillants et à la réponse aux incidents.

DeepMind liste des résultats sur CTI-MCQ, CTI-RCM, MARS-EVAL et CyberSecEval. Google évoque jusqu'à 65% de gains face à 3.5 Flash sur certains benchmarks de cybersécurité. Ce chiffre concerne ces tests; en entreprise, il faudra encore mesurer les faux positifs, les manques et le coût de revue humaine.

Le CEO de Google, Sundar Pichai, a décrit l'opportunité de l'IA comme immense.

Les clients achètent un équilibre

La page de Google cite Vincent van der Meulen, responsable engineering chez Figma: pour Figma Make, l'entreprise cherche un équilibre entre qualité, vitesse et coût.

C'est la logique commerciale de Flash. Les outils de design, assistants de code, analyses de tableurs et systèmes de support n'ont pas besoin du même modèle à chaque étape. Les tâches fréquentes et vérifiables peuvent utiliser un modèle moins cher; les tâches sensibles montent vers un modèle plus fort.

La charge réelle tranchera

Les 350 tokens/s de Flash-Lite relèvent d'un contexte de benchmark. En production, la latence dépendra de la longueur du prompt, des appels d'outils, du réseau et des limites de débit. Le gain de 65% de Flash Cyber reste aussi lié aux benchmarks de sécurité cités.

Google n'a pas seulement lancé un modèle plus puissant. Il a séparé plusieurs charges en plusieurs produits. La prochaine bataille se jouera sur les coûts, la latence, les limites de sécurité et l'intégration au workflow.

Sources: blog officiel de Google, pages modèles Google DeepMind, Axios, Business Insider, Artificial Analysis, CocoLoop; vérification des rôles des trois modèles Flash, du périmètre tokens/s, des prix par million de tokens, des gains en benchmark cybersécurité, de la citation client et de la disponibilité.