Google dévoile Gemini 2.5 Pro, axé sur les capacités de raisonnement

Fin mars de l'année dernière, Google a publié Gemini 2.5 Pro, officiellement décrit comme le « modèle le plus intelligent à ce jour ».

Ce genre d'affirmation, chaque entreprise le fait, mais cette fois, les scores de Gemini 2.5 Pro ont vraiment de quoi impressionner :

Raisonnement mathématique et scientifique

  • AIME 2024 : 92,0 %
  • AIME 2025 : 86,7 %
  • Humanity's Last Exam : 18,8 % (le plus élevé parmi les modèles n'utilisant pas d'outils)

Ce dernier test a été conçu par des centaines d'experts dans divers domaines pour tester les « frontières de la connaissance humaine ». Atteindre près de 20 % de précision est un résultat assez fracassant.

Code et multimodalité

  • LiveCodeBench : Première place en programmation compétitive
  • MMMU : 84,0 % (raisonnement multimodal)
  • WebDevArena Elo : 1443 (première place au classement)

Capacité contextuelle

Standard avec un contexte de 1 million de tokens (extensible à 2 millions), prend en charge les entrées multimodales telles que le texte, l'audio, les images et la vidéo. Un dépôt de code entier peut être traité directement, sans avoir à le découper.

Gemini 2.5 Pro est un « thinking model » – il effectue un raisonnement interne avant de répondre. Cette conception s'inscrit dans la même lignée que la série o d'OpenAI et DeepSeek R1, mais l'implémentation de Google se montre plus équilibrée dans les scénarios multimodaux.

Cependant, un problème est fréquemment mentionné dans l'utilisation réelle : la vitesse de réponse. Un raisonnement profond implique des temps d'attente plus longs, ce qui nuit à l'expérience dans les situations nécessitant une interaction rapide. C'est un compromis commun à tous les thinking models.

Sur LMArena, le score Elo a atteint 1470, soit une augmentation de 24 points par rapport à la période précédant le lancement, maintenant la première place au classement. Google a été longtemps critiqué dans le domaine de l'IA, et cette fois, l'entreprise a répondu par la qualité de son produit.

Source de référence : CocoLoop, rapport de VentureBeat, annonce officielle de Google