Le 30 septembre, Google a dévoilé son modèle de pointe de nouvelle génération, Gemini 4 Argon, mais son accès initial est réservé aux équipes de cyberdéfense inscrites au programme Fairwind. Google limite le champ d'usage du modèle à trois catégories : l'ingénierie logicielle, le travail de connaissance en entreprise comme le droit et la finance, et la défense en cybersécurité. Les clients API payants et les abonnés Google AI Ultra arriveront dans une prochaine vague, sans calendrier annoncé pour une ouverture publique plus large.
Donner la priorité aux équipes de sécurité tient à l'orientation d'entraînement du modèle. Selon Google, Argon a été spécifiquement entraîné à la cyberdéfense et peut découvrir, vérifier et corriger de façon autonome des vulnérabilités logicielles critiques. Pour les équipes de défense de confiance au sein de Fairwind et les équipes internes de Google, Argon est fourni sans les garde-fous habituels de cybersécurité ; les autres utilisateurs reçoivent une version dotée de mesures de protection contre les abus, l'injection de prompt et d'une surveillance de l'alignement.
Le bulletin de résultats officiel
Google a publié plusieurs scores de benchmarks :
| Benchmark | Domaine | Score d'Argon |
|---|---|---|
| DeepSWE v1.1 | Ingénierie logicielle réelle | 77,9 % |
| CWE-bench v1 | Correction de vulnérabilités | 68 % (ex æquo en tête) |
| AutomationBench | Tâches d'automatisation | 51,3 % (premier) |
| LVBench | Compréhension de vidéos longues | 91,7 % |
Pour deux autres tests, seul le classement a été communiqué : sur le Vals Index, qui couvre la finance, la programmation, le droit et la fiscalité, Google affirme qu'Argon est en tête ; sur le test d'injection de prompt indirecte de Gray Swan, Google indique que la résistance d'Argon y est la meilleure. Tous ces chiffres sont déclarés par l'entreprise elle-même, et le jour du lancement, une seule contre-évaluation indépendante était disponible.
La longueur de sortie constitue un autre changement notable. La génération précédente de Gemini plafonnait à 64 000 tokens par réponse ; Argon porte cette limite à 1 million de tokens, tout comme sa fenêtre de contexte.
Tarifs et tests indépendants
Pendant la période de lancement, l'API est facturée au tarif promotionnel : 2 dollars par million de tokens en entrée, 10 dollars par million de tokens en sortie, avec une réduction supplémentaire de 95 % sur l'entrée en cas de succès du cache. Une fois la promotion terminée, les tarifs remonteront à 4 dollars en entrée et 20 dollars en sortie ; Google n'a pas précisé la durée de cette période promotionnelle.
L'évaluateur indépendant Artificial Analysis a publié ses résultats le jour même. Argon obtient 53 points sur son indice d'intelligence, à égalité avec le niveau de raisonnement le plus élevé de GPT-6 Astra, un point de plus que le niveau le plus élevé de GPT-6.1 Sol, et 23 points de plus que les 30 points de la génération précédente, Gemini 3.1 Pro Preview.
En comparant le coût par tâche à partir du même indice :
- Argon coûte environ 1,99 dollar par tâche au tarif promotionnel, contre 3,26 dollars pour GPT-6 Astra ;
- une fois la promotion terminée, Argon grimpe à environ 3,98 dollars, soit environ 20 % de plus qu'Astra ;
- GPT-6.1 Sol coûte seulement environ 0,72 dollar par tâche pour un score inférieur d'à peine 1 point, ce qui rend Argon environ 2,8 fois plus cher au tarif promotionnel.
L'écart s'explique surtout par la consommation de tokens. Selon Artificial Analysis, Argon génère en moyenne environ 62 000 tokens de sortie par tâche, contre environ 27 000 pour GPT-6 Astra, soit plus du double. Le prix unitaire ayant été divisé par deux mais le volume de sortie doublé, l'avantage tarifaire au prix plein est quasiment annulé. Argon prend en charge un mécanisme appelé « poursuite de décodage longue », où le raisonnement peut aller jusqu'à écrire 1 million de tokens de sortie, ce qui explique sa consommation plus élevée dans les tests d'indice.
À qui s'adressent les garde-fous
La même semaine, OpenAI venait d'annuler le lancement de GPT-6.1 Astra, invoquant des standards de sécurité non atteints, pour lui préférer le modèle moins coûteux Sol. L'approche de Google consiste à placer d'abord sa version la plus puissante sur une liste contrôlée. Les deux entreprises procèdent différemment, mais font face au même type de capacité : plus un modèle excelle à trouver des vulnérabilités et à écrire des correctifs, plus le risque qu'il soit détourné à des fins d'attaque augmente.
Le blog de lancement de Google ne précise ni quelles organisations figurent sur la liste Fairwind, ni les critères d'évaluation, ni comment la version sans garde-fous est protégée contre les fuites. Pour les développeurs en Chine, Argon reste pour l'instant difficile d'accès : Fairwind fonctionne sur invitation, aucune date n'est fixée pour l'ouverture d'Ultra et de l'API payante, et l'API Gemini elle-même n'est pas disponible en Chine continentale.
Sources : blog officiel de Google, rapport d'évaluation d'Artificial Analysis, CocoLoop, VentureBeat ; les scores de benchmarks sont ceux communiqués par Google, le coût par tâche et la consommation de tokens suivent l'indice d'intelligence d'Artificial Analysis.