Gemini 3.1 Pro décroche 12 premières places sur 18 tests de benchmark

Fin février, Google DeepMind a publié Gemini 3.1 Pro. Après le lancement, un chiffre s'est largement répandu dans la communauté des développeurs : sur les 18 benchmarks majeurs actuellement suivis, 3.1 Pro a décroché 12 premières places.

Encore plus remarquable est l'ARC-AGI-2 — un test spécialement conçu pour évaluer la capacité du modèle à résoudre des « problèmes logiques nouveaux jamais vus », empêchant le modèle de mémoriser les données d'entraînement pour réussir. 3.1 Pro a obtenu 77,1 % à ce test.

Ce que signifie réellement le doublement de la capacité de raisonnement

Google a officiellement déclaré que la capacité de raisonnement du 3.1 Pro est plus de deux fois supérieure à celle du Gemini 3 Pro.

Cela semble vague, mais combiné aux résultats de l'ARC-AGI-2, cela devient convaincant. L'ARC-AGI présente des questions entièrement nouvelles à chaque fois, exigeant que le modèle voie quelques exemples, généralise des règles et les applique — impossible de se fier à la mémorisation des réponses, seul le véritable raisonnement compte.

Une amélioration du double correspond approximativement à : face à un problème complexe en plusieurs étapes, le modèle peut analyser, déduire et vérifier par lui-même, sans que vous ayez à le guider pas à pas dans le prompt. Un nouveau niveau de réflexion MEDIUM a été ajouté (auparavant, il n'y avait que deux niveaux : activé/désactivé), permettant désormais de contrôler la profondeur du raisonnement — toutes les tâches n'ont pas besoin du raisonnement le plus profond, il peut être ajusté selon les besoins.

Spécifications techniques

Contexte et sortie :

  • Fenêtre de contexte : 1 million de tokens
  • Sortie maximale : 65K tokens

Formats d'entrée pris en charge :

  • Texte et code
  • Images (maximum 3000 images par fois, chaque image jusqu'à 7 Mo)
  • Audio (maximum 8,4 heures)
  • Vidéo (avec audio environ 45 minutes, vidéo seule environ 1 heure)
  • PDF (maximum 3000 pages par fois, fichier unique jusqu'à 50 Mo)

Que peut contenir 1 million de tokens ? Environ l'intégralité du code d'un grand dépôt de code, ou 900 pages de PDF, ou 8,4 heures d'audio de podcast. Jeter tout le projet et poser des questions directement, c'est désormais réellement possible.

Fonctionnalités pratiques

Outre la capacité de raisonnement, 3.1 Pro a ajouté quelques fonctionnalités utiles :

  • Grounding with Google Search : recherche en temps réel lors des réponses, réduisant les problèmes liés à la date de coupure des connaissances
  • Exécution de code : le modèle peut exécuter du code directement pour vérifier les résultats, pas seulement générer du code
  • Optimisation spécialisée pour la Finance et les feuilles de calcul : ces deux scénarios d'agent ont été ajustés spécifiquement
  • Intégration du moteur RAG : connexion plus facile aux bases de connaissances d'entreprise

La prédiction par lots est également prise en charge, et les coûts pour les tâches à contexte long sont bien inférieurs avec l'utilisation du cache.

Tarification

ÉlémentPrix
Entrée2,00 $/M token
Sortie12,00 $/M token
Entrée en mode Raisonnement12,00 $/M token
Lecture du cache0,20 $/M token
Écriture du cache0,38 $/M token

Comparé à Claude Opus 4.6 (15 $/75 $), c'est beaucoup moins cher et proche de GPT-5.4 Pro. Avec une utilisation intensive du cache, les coûts pour les tâches à contexte long sont considérablement réduits.

Actuellement en aperçu public, la date de coupure des connaissances est janvier 2025.

Mais la première place globale ne lui appartient pas encore

Pour être honnête : dans le classement global des benchmarks, le score de GPT-5.4 Pro est de 92 (BenchLM.ai), Gemini 3.1 Pro de 87, Claude Opus 4.6 de 85.

A gagné 12/18 tests individuels, mais il manque encore un peu dans certaines dimensions clés de capacité. En particulier pour les tâches de programmation, les performances de Claude Opus 4.6 sur SWE-bench restent plus fortes.

Google a présenté cette réponse en matière de raisonnement et de traitement multimodal, mais la première place globale ne leur appartient pas encore.

Vaut-il la peine de migrer ?

Si votre activité est principalement :

  • Traitement de documents longs (contrats, rapports, révision de dépôts de code)
  • Entrée multimodale (traitement simultané d'images + texte + audio)
  • Budget limité mais besoin d'une capacité de raisonnement proche du niveau Opus

3.1 Pro est une option sérieuse, avec un rapport qualité-prix assez compétitif.

Mais si le besoin principal est d'écrire du code ou de travailler avec des agents, Claude reste plus mature. Avec 77,1 % sur ARC-AGI-2, Google montre dans ce lancement que la capacité de raisonnement progresse réellement, ce n'est pas seulement du score. Mais pour remplacer complètement Claude et GPT-5.4, il manque encore un peu de distance.

Sources de référence : Google's new Gemini Pro model has record benchmark scores — again (TechCrunch) ; CocoLoop, Gemini 3.1 Pro: A smarter model for your most complex tasks (Google DeepMind Blog) ; Gemini 3.1 Pro Preview Model Specs, Costs & Benchmarks (Galaxy.ai) ; Gemini 3.1 Pro | Google Cloud Vertex AI Documentation