Gemini 3.1 Pro conquista 12 primeiras posições em 18 testes de benchmark

No final de fevereiro, o Google DeepMind lançou o Gemini 3.1 Pro. Após o lançamento, um número se espalhou amplamente na comunidade de desenvolvedores: nos 18 principais benchmarks atualmente monitorados, o 3.1 Pro conquistou 12 primeiras posições.

Mais notável ainda é o ARC-AGI-2 — um teste projetado especificamente para avaliar a capacidade do modelo de resolver "problemas lógicos novos nunca vistos", impedindo que o modelo decore dados de treinamento para passar. O 3.1 Pro alcançou 77,1% neste teste.

O que a duplicação da capacidade de raciocínio realmente significa

O Google afirmou oficialmente que a capacidade de raciocínio do 3.1 Pro é mais de duas vezes superior à do Gemini 3 Pro.

Isso soa vago, mas combinado com os resultados do ARC-AGI-2, torna-se convincente. O ARC-AGI apresenta perguntas totalmente novas a cada vez, exigindo que o modelo veja alguns exemplos, generalize regras e as aplique — não é possível confiar na memorização de respostas, apenas no raciocínio real.

Uma melhoria de duas vezes corresponde aproximadamente a: dado um problema complexo de várias etapas, o modelo pode analisar, deduzir e verificar por conta própria, sem que você precise guiá-lo passo a passo no prompt. Um novo Nível de Pensamento MEDIUM foi adicionado (antes havia apenas dois níveis: ligado/desligado), permitindo agora controlar a profundidade do raciocínio — nem toda tarefa precisa do raciocínio mais profundo, pode ser ajustado conforme a necessidade.

Especificações técnicas

Contexto e saída:

  • Janela de contexto: 1 milhão de tokens
  • Saída máxima: 65K tokens

Formatos de entrada suportados:

  • Texto e código
  • Imagens (máximo de 3000 imagens por vez, cada uma com até 7MB)
  • Áudio (máximo de 8,4 horas)
  • Vídeo (com áudio cerca de 45 minutos, apenas vídeo cerca de 1 hora)
  • PDF (máximo de 3000 páginas por vez, arquivo único de até 50MB)

O que cabe em 1 milhão de tokens? Aproximadamente todo o código de um repositório de código grande, ou 900 páginas de PDF, ou 8,4 horas de áudio de podcast. Jogar o projeto inteiro e fazer perguntas diretamente — agora é realmente possível.

Funcionalidades úteis

Além da capacidade de raciocínio, o 3.1 Pro adicionou alguns recursos práticos:

  • Grounding with Google Search: pesquisa em tempo real ao responder, reduzindo problemas relacionados à data de corte do conhecimento
  • Execução de código: o modelo pode executar código diretamente para verificar resultados, não apenas gerar código
  • Otimização especializada para Finanças e Planilhas: esses dois cenários de agente foram ajustados especificamente
  • Integração com RAG Engine: conexão mais fácil com bases de conhecimento empresariais

Também suporta previsão em lote, e os custos para tarefas de contexto longo são muito menores com o uso de cache.

Precificação

ItemPreço
Entrada$2,00/M token
Saída$12,00/M token
Entrada no modo Raciocínio$12,00/M token
Leitura de cache$0,20/M token
Escrita de cache$0,38/M token

Comparado ao Claude Opus 4.6 ($15/$75), é muito mais barato e próximo ao GPT-5.4 Pro. Com uso intensivo de cache, os custos para tarefas de contexto longo são bastante reduzidos.

Atualmente em pré-visualização pública, data de corte do conhecimento é janeiro de 2025.

Mas a liderança geral ainda não é dele

Para ser honesto: no ranking geral de benchmarks, a pontuação do GPT-5.4 Pro é 92 (BenchLM.ai), Gemini 3.1 Pro é 87, Claude Opus 4.6 é 85.

Venceu 12/18 testes individuais, mas ainda falta um pouco em algumas dimensões-chave de capacidade. Especialmente em tarefas de programação, o desempenho do Claude Opus 4.6 no SWE-bench ainda é mais forte.

O Google apresentou esta resposta em raciocínio e processamento multimodal, mas a liderança geral ainda não é deles.

Vale a pena migrar?

Se o seu negócio é principalmente:

  • Processamento de documentos longos (contratos, relatórios, revisão de repositórios de código)
  • Entrada multimodal (processamento simultâneo de imagens + texto + áudio)
  • Orçamento limitado, mas necessidade de capacidade de raciocínio próxima ao nível Opus

O 3.1 Pro é uma opção séria, com uma relação custo-benefício bastante competitiva.

Mas se a necessidade principal é escrever código ou trabalhar com agentes, o Claude ainda é mais maduro. Com 77,1% no ARC-AGI-2, o Google mostra neste lançamento que a capacidade de raciocínio está realmente progredindo, não é apenas pontuação. Mas para substituir completamente o Claude e o GPT-5.4, ainda falta um pouco de distância.

Fontes de referência: Google's new Gemini Pro model has record benchmark scores — again (TechCrunch); CocoLoop, Gemini 3.1 Pro: A smarter model for your most complex tasks (Google DeepMind Blog); Gemini 3.1 Pro Preview Model Specs, Costs & Benchmarks (Galaxy.ai); Gemini 3.1 Pro | Google Cloud Vertex AI Documentation