A finales de febrero, Google DeepMind lanzó Gemini 3.1 Pro. Tras el lanzamiento, un número se difundió ampliamente en la comunidad de desarrolladores: en los 18 benchmarks principales que se rastrean actualmente, 3.1 Pro obtuvo 12 primeros puestos.
Aún más notable es ARC-AGI-2, una prueba diseñada específicamente para evaluar la capacidad del modelo de resolver "problemas lógicos nuevos nunca vistos", evitando que el modelo memorice datos de entrenamiento para aprobar. 3.1 Pro alcanzó un 77,1% en esta prueba.
Qué significa realmente duplicar la capacidad de razonamiento
Google declaró oficialmente que la capacidad de razonamiento de 3.1 Pro es más del doble que la de Gemini 3 Pro.
Esto suena vago, pero combinado con los resultados de ARC-AGI-2 resulta convincente. ARC-AGI presenta preguntas completamente nuevas cada vez, exigiendo que el modelo vea algunos ejemplos, generalice reglas y las aplique; no se puede confiar en memorizar respuestas, solo en el razonamiento real.
Una mejora del doble corresponde aproximadamente a: dado un problema complejo de varios pasos, el modelo puede analizar, deducir y verificar por sí mismo, sin necesidad de guiarlo paso a paso en el prompt. Se ha añadido un nuevo Nivel de Pensamiento MEDIUM (antes solo había dos niveles: activado/desactivado), permitiendo ahora controlar la profundidad del razonamiento; no todas las tareas necesitan el razonamiento más profundo, se puede ajustar según la necesidad.
Especificaciones técnicas
Contexto y salida:
- Ventana de contexto: 1 millón de tokens
- Salida máxima: 65K tokens
Formatos de entrada compatibles:
- Texto y código
- Imágenes (máximo 3000 imágenes por vez, cada una de hasta 7MB)
- Audio (máximo 8,4 horas)
- Video (con audio unos 45 minutos, solo video aproximadamente 1 hora)
- PDF (máximo 3000 páginas por vez, archivo único de hasta 50MB)
¿Qué cabe en 1 millón de tokens? Aproximadamente todo el código de un repositorio de código grande, o 900 páginas de PDF, o 8,4 horas de audio de podcast. Arrojar todo el proyecto y hacer preguntas directamente, ahora es realmente posible.
Funcionalidades útiles
Además de la capacidad de razonamiento, 3.1 Pro añadió algunas funciones prácticas:
- Grounding with Google Search: búsqueda en tiempo real al responder, reduciendo problemas relacionados con la fecha de corte del conocimiento
- Ejecución de código: el modelo puede ejecutar código directamente para verificar resultados, no solo generar código
- Optimización especializada para Finanzas y Hojas de cálculo: estos dos escenarios de agente fueron ajustados específicamente
- Integración con RAG Engine: conexión más fácil con bases de conocimiento empresariales
También admite predicción por lotes, y los costos para tareas de contexto largo son mucho menores con el uso de caché.
Precios
| Ítem | Precio |
|---|---|
| Entrada | $2,00/M token |
| Salida | $12,00/M token |
| Entrada en modo Razonamiento | $12,00/M token |
| Lectura de caché | $0,20/M token |
| Escritura de caché | $0,38/M token |
Comparado con Claude Opus 4.6 ($15/$75), es mucho más barato y cercano a GPT-5.4 Pro. Con un uso intensivo de caché, los costos para tareas de contexto largo se reducen bastante.
Actualmente en vista previa pública, la fecha de corte del conocimiento es enero de 2025.
Pero el primer puesto general aún no es suyo
Para ser honesto: en el ranking general de benchmarks, la puntuación de GPT-5.4 Pro es 92 (BenchLM.ai), Gemini 3.1 Pro es 87, Claude Opus 4.6 es 85.
Ganó 12/18 pruebas individuales, pero aún falta un poco en algunas dimensiones clave de capacidad. Especialmente en tareas de programación, el rendimiento de Claude Opus 4.6 en SWE-bench sigue siendo más fuerte.
Google presentó esta respuesta en razonamiento y procesamiento multimodal, pero el primer puesto general aún no es suyo.
¿Vale la pena migrar?
Si su negocio es principalmente:
- Procesamiento de documentos largos (contratos, informes, revisión de repositorios de código)
- Entrada multimodal (procesamiento simultáneo de imágenes + texto + audio)
- Presupuesto limitado pero necesidad de capacidad de razonamiento cercana al nivel Opus
3.1 Pro es una opción seria, con una relación costo-beneficio bastante competitiva.
Pero si la necesidad principal es escribir código o trabajar con agentes, Claude sigue siendo más maduro. Con un 77,1% en ARC-AGI-2, Google demuestra en este lanzamiento que la capacidad de razonamiento realmente está progresando, no es solo puntuación. Pero para reemplazar completamente a Claude y GPT-5.4, aún falta un poco de distancia.
Fuentes de referencia: Google's new Gemini Pro model has record benchmark scores — again (TechCrunch); CocoLoop, Gemini 3.1 Pro: A smarter model for your most complex tasks (Google DeepMind Blog); Gemini 3.1 Pro Preview Model Specs, Costs & Benchmarks (Galaxy.ai); Gemini 3.1 Pro | Google Cloud Vertex AI Documentation