No final de março do ano passado, o Google lançou o Gemini 2.5 Pro, descrito oficialmente como o "modelo mais inteligente até hoje".
Esse tipo de afirmação é comum, mas desta vez as pontuações do Gemini 2.5 Pro realmente chamam a atenção:
Raciocínio matemático e científico
- AIME 2024: 92,0%
- AIME 2025: 86,7%
- Humanity's Last Exam: 18,8% (maior pontuação entre modelos que não usam ferramentas)
Este último teste foi elaborado por centenas de especialistas em diversas áreas para testar as "fronteiras do conhecimento humano". Alcançar quase 20% de precisão é um resultado impressionante.
Código e multimodalidade
- LiveCodeBench: Primeiro lugar em programação competitiva
- MMMU: 84,0% (raciocínio multimodal)
- WebDevArena Elo: 1443 (primeiro lugar no ranking)
Capacidade de contexto
Padrão com 1 milhão de tokens de contexto (expansível para 2 milhões), suporta entrada multimodal como texto, áudio, imagem e vídeo. Um repositório de código inteiro pode ser processado diretamente, sem necessidade de dividi-lo.
O Gemini 2.5 Pro é um "thinking model" – ele realiza um raciocínio interno antes de responder. Este conceito de design segue a mesma linha da série o da OpenAI e do DeepSeek R1, mas a implementação do Google se mostra mais equilibrada em cenários multimodais.
No entanto, um problema é frequentemente mencionado no uso real: a velocidade de resposta. O raciocínio profundo implica tempos de espera mais longos, prejudicando a experiência em situações que exigem interação rápida. Este é um trade-off comum a todos os thinking models.
No LMArena, a pontuação Elo atingiu 1470, um aumento de 24 pontos em relação ao período anterior ao lançamento, mantendo a liderança no ranking. O Google foi criticado por muito tempo no campo da IA, e desta vez respondeu com a qualidade do produto.
Fonte de referência: CocoLoop, reportagem da VentureBeat, anúncio oficial do Google