No final de fevereiro, o Google DeepMind lançou o Gemini 3.1 Pro. Após o lançamento, um número se espalhou amplamente na comunidade de desenvolvedores: nos 18 principais benchmarks atualmente monitorados, o 3.1 Pro conquistou 12 primeiras posições.
Mais notável ainda é o ARC-AGI-2 — um teste projetado especificamente para avaliar a capacidade do modelo de resolver "problemas lógicos novos nunca vistos", impedindo que o modelo decore dados de treinamento para passar. O 3.1 Pro alcançou 77,1% neste teste.
O que a duplicação da capacidade de raciocínio realmente significa
O Google afirmou oficialmente que a capacidade de raciocínio do 3.1 Pro é mais de duas vezes superior à do Gemini 3 Pro.
Isso soa vago, mas combinado com os resultados do ARC-AGI-2, torna-se convincente. O ARC-AGI apresenta perguntas totalmente novas a cada vez, exigindo que o modelo veja alguns exemplos, generalize regras e as aplique — não é possível confiar na memorização de respostas, apenas no raciocínio real.
Uma melhoria de duas vezes corresponde aproximadamente a: dado um problema complexo de várias etapas, o modelo pode analisar, deduzir e verificar por conta própria, sem que você precise guiá-lo passo a passo no prompt. Um novo Nível de Pensamento MEDIUM foi adicionado (antes havia apenas dois níveis: ligado/desligado), permitindo agora controlar a profundidade do raciocínio — nem toda tarefa precisa do raciocínio mais profundo, pode ser ajustado conforme a necessidade.
Especificações técnicas
Contexto e saída:
- Janela de contexto: 1 milhão de tokens
- Saída máxima: 65K tokens
Formatos de entrada suportados:
- Texto e código
- Imagens (máximo de 3000 imagens por vez, cada uma com até 7MB)
- Áudio (máximo de 8,4 horas)
- Vídeo (com áudio cerca de 45 minutos, apenas vídeo cerca de 1 hora)
- PDF (máximo de 3000 páginas por vez, arquivo único de até 50MB)
O que cabe em 1 milhão de tokens? Aproximadamente todo o código de um repositório de código grande, ou 900 páginas de PDF, ou 8,4 horas de áudio de podcast. Jogar o projeto inteiro e fazer perguntas diretamente — agora é realmente possível.
Funcionalidades úteis
Além da capacidade de raciocínio, o 3.1 Pro adicionou alguns recursos práticos:
- Grounding with Google Search: pesquisa em tempo real ao responder, reduzindo problemas relacionados à data de corte do conhecimento
- Execução de código: o modelo pode executar código diretamente para verificar resultados, não apenas gerar código
- Otimização especializada para Finanças e Planilhas: esses dois cenários de agente foram ajustados especificamente
- Integração com RAG Engine: conexão mais fácil com bases de conhecimento empresariais
Também suporta previsão em lote, e os custos para tarefas de contexto longo são muito menores com o uso de cache.
Precificação
| Item | Preço |
|---|---|
| Entrada | $2,00/M token |
| Saída | $12,00/M token |
| Entrada no modo Raciocínio | $12,00/M token |
| Leitura de cache | $0,20/M token |
| Escrita de cache | $0,38/M token |
Comparado ao Claude Opus 4.6 ($15/$75), é muito mais barato e próximo ao GPT-5.4 Pro. Com uso intensivo de cache, os custos para tarefas de contexto longo são bastante reduzidos.
Atualmente em pré-visualização pública, data de corte do conhecimento é janeiro de 2025.
Mas a liderança geral ainda não é dele
Para ser honesto: no ranking geral de benchmarks, a pontuação do GPT-5.4 Pro é 92 (BenchLM.ai), Gemini 3.1 Pro é 87, Claude Opus 4.6 é 85.
Venceu 12/18 testes individuais, mas ainda falta um pouco em algumas dimensões-chave de capacidade. Especialmente em tarefas de programação, o desempenho do Claude Opus 4.6 no SWE-bench ainda é mais forte.
O Google apresentou esta resposta em raciocínio e processamento multimodal, mas a liderança geral ainda não é deles.
Vale a pena migrar?
Se o seu negócio é principalmente:
- Processamento de documentos longos (contratos, relatórios, revisão de repositórios de código)
- Entrada multimodal (processamento simultâneo de imagens + texto + áudio)
- Orçamento limitado, mas necessidade de capacidade de raciocínio próxima ao nível Opus
O 3.1 Pro é uma opção séria, com uma relação custo-benefício bastante competitiva.
Mas se a necessidade principal é escrever código ou trabalhar com agentes, o Claude ainda é mais maduro. Com 77,1% no ARC-AGI-2, o Google mostra neste lançamento que a capacidade de raciocínio está realmente progredindo, não é apenas pontuação. Mas para substituir completamente o Claude e o GPT-5.4, ainda falta um pouco de distância.
Fontes de referência: Google's new Gemini Pro model has record benchmark scores — again (TechCrunch); CocoLoop, Gemini 3.1 Pro: A smarter model for your most complex tasks (Google DeepMind Blog); Gemini 3.1 Pro Preview Model Specs, Costs & Benchmarks (Galaxy.ai); Gemini 3.1 Pro | Google Cloud Vertex AI Documentation