Opus 4.6 lanzado: el modelo decide por sí mismo si pensar en profundidad

El 5 de febrero, Anthropic lanzó Opus 4.6, cuya actualización principal se denomina Adaptive Thinking (Pensamiento Adaptativo).

Antes vs. Ahora

Antes, al usar extended thinking, era necesario establecer manualmente un presupuesto — decidir si el modelo debía pensar 10 o 30 segundos dependía exclusivamente del desarrollador. Ahora, Opus 4.6 decide por sí mismo:

  • Preguntas simples → respuesta inmediata, sin desperdiciar capacidad de cómputo
  • Preguntas complejas → activa automáticamente el modo de razonamiento profundo
  • Recursos computacionales asignados según la necesidad

El principio subyacente es que el modelo realiza una evaluación de dificultad en el instante en que recibe el prompt y luego ajusta dinámicamente la profundidad del razonamiento. Se ofrecen cuatro niveles de ajuste manual (low/medium/high/max), con high como valor predeterminado.

Ventana de contexto máxima

  • Contexto: 1 millón de tokens (beta)
  • Salida máxima: 128K tokens
  • Precisión de recuperación MRCR v2: 93% en contexto de 256K, aún 76% al llegar a 1 millón

En comparación, la fiabilidad de recuperación de Sonnet 4.5 en la misma prueba es solo de un cuarto a un noveno de la de Opus 4.6. La diferencia es considerable.

Mejoras significativas en escenarios de agente

BenchmarkPuntuación
Terminal Bench59,8% → 65,4%
OSWorld66,3% → 72,7%

Ambos resultados superan a GPT-5.2 y Gemini 3 Pro.

Otra función potente es la Compaction API — que comprime automáticamente el historial de la conversación en el lado del servidor, lo que teóricamente permite conversaciones de longitud infinita. En escenarios de agente que ejecutan decenas de rondas de interacción para completar tareas complejas de programación, esta capacidad determina directamente la tasa de éxito de la tarea.

Fuentes de referencia: Reportaje de The New Stack sobre Opus 4.6, CocoLoop, documentación oficial de Anthropic