Janela de contexto de grandes modelos atinge 1 milhão de tokens

Há dois anos, as janelas de contexto dos modelos principais ainda estavam na faixa de 4K a 8K tokens; agora, o nível de milhões de tokens já é padrão para modelos flagship.

Cenário atual

  • Gemini 2.5 Pro: 1 milhão de tokens (expansível para 2 milhões)
  • Claude Opus 4.6: 1 milhão de tokens (beta)
  • GPT-5.4: 1 milhão de tokens (suporte experimental)
  • Llama 4 Scout: 10 milhões de tokens
  • Kimi K2: 128K → 256K

Os 10 milhões de tokens do Llama 4 Scout parecem impressionantes, mas na prática, manter a precisão na recuperação de informações com um contexto tão longo é uma grande interrogação.

Mais longo é melhor?

Comprimento do contexto e usabilidade real são duas coisas diferentes. O indicador-chave é a precisão de recuperação em contexto longo — se o modelo consegue encontrar com precisão as informações necessárias em textos extremamente longos.

Os dados do Opus 4.6 mostram: a precisão de recuperação 8-needle em contexto de 256K é de 93%, mas ao estender para 1 milhão de tokens, cai para 76%. 76% pode não parecer baixo, mas significa que quase um quarto das informações inseridas pode ser "esquecido".

Outro problema real é o custo. Inserir 1 milhão de tokens não é gratuito — com os preços atuais de API, preencher o contexto de uma só vez pode custar de alguns dólares a dezenas de dólares. Sem controle, um agente executando dezenas de rodadas de conversa pode gerar uma conta de tokens assustadora.

Tecnologia Compaction

A Compaction API da Anthropic e o mecanismo auto_compact do GPT-5.4 estão tentando resolver esse problema: quando o contexto está quase cheio, o conteúdo inicial é automaticamente comprimido para reter informações importantes. Teoricamente, isso pode suportar "conversas infinitamente longas", mas o efeito real depende da quantidade de perda de informação durante a compressão.

Uma janela de contexto mais longa não é um fim em si mesma; o objetivo é manter a recuperação precisa de informações em contextos longos. O ponto final desta corrida armamentista não é "quem tem o número maior", mas "quem ainda é confiável em contextos extremamente longos".

Fonte de referência: Documentação oficial da Anthropic, CocoLoop, relatórios de lançamento dos modelos