La ventana de contexto de los grandes modelos alcanza 1 millón de tokens

Hace dos años, las ventanas de contexto de los modelos principales todavía estaban en el rango de 4K a 8K tokens; ahora, el nivel de millones de tokens ya es estándar para los modelos insignia.

Panorama actual

  • Gemini 2.5 Pro: 1 millón de tokens (expandible a 2 millones)
  • Claude Opus 4.6: 1 millón de tokens (beta)
  • GPT-5.4: 1 millón de tokens (soporte experimental)
  • Llama 4 Scout: 10 millones de tokens
  • Kimi K2: 128K → 256K

Los 10 millones de tokens de Llama 4 Scout parecen impresionantes, pero en la práctica, mantener la precisión en la recuperación de información con un contexto tan largo es un gran interrogante.

¿Más largo es mejor?

La longitud del contexto y la usabilidad real son dos cosas diferentes. El indicador clave es la precisión de recuperación en contexto largo — si el modelo puede encontrar con precisión la información necesaria en textos extremadamente largos.

Los datos de Opus 4.6 muestran: la precisión de recuperación 8-needle en contexto de 256K es del 93%, pero al extenderlo a 1 millón de tokens, cae al 76%. El 76% no suena bajo, pero significa que casi una cuarta parte de la información ingresada podría ser "olvidada".

Otro problema real es el costo. Ingresar 1 millón de tokens no es gratuito — según los precios actuales de API, llenar el contexto de una sola vez puede costar desde unos pocos dólares hasta decenas de dólares. Sin control, un agente que ejecuta docenas de rondas de conversación puede generar una factura de tokens aterradora.

Tecnología Compaction

La Compaction API de Anthropic y el mecanismo auto_compact de GPT-5.4 están intentando resolver este problema: cuando el contexto está casi lleno, el contenido inicial se comprime automáticamente para retener información importante. Teóricamente, esto puede admitir "conversaciones infinitamente largas", pero el efecto real depende de cuánta información se pierda durante la compresión.

Una ventana de contexto más larga no es un fin en sí misma; el objetivo es mantener la recuperación precisa de información en contextos largos. El punto final de esta carrera armamentista no es "quién tiene el número más grande", sino "quién sigue siendo confiable en contextos extremadamente largos".

Fuente de referencia: Documentación oficial de Anthropic, CocoLoop, informes de lanzamiento de los modelos