La fenêtre de contexte des grands modèles atteint 1 million de tokens

Il y a deux ans, les fenêtres de contexte des modèles dominants étaient encore de l'ordre de 4K à 8K tokens ; désormais, le niveau du million de tokens est devenu la norme pour les modèles phares.

Situation actuelle

  • Gemini 2.5 Pro : 1 million de tokens (extensible à 2 millions)
  • Claude Opus 4.6 : 1 million de tokens (bêta)
  • GPT-5.4 : 1 million de tokens (support expérimental)
  • Llama 4 Scout : 10 millions de tokens
  • Kimi K2 : 128K → 256K

Les 10 millions de tokens de Llama 4 Scout semblent impressionnants, mais dans la pratique, maintenir la précision de récupération d'informations avec un contexte aussi long reste un grand point d'interrogation.

Plus long est-il meilleur ?

La longueur du contexte et l'utilisabilité réelle sont deux choses différentes. L'indicateur clé est la précision de récupération en contexte long — si le modèle peut trouver avec précision les informations nécessaires dans des textes extrêmement longs.

Les données d'Opus 4.6 montrent : la précision de récupération 8-needle en contexte de 256K est de 93 %, mais lorsqu'on passe à 1 million de tokens, elle chute à 76 %. 76 % peut sembler élevé, mais cela signifie que près d'un quart des informations que vous insérez peuvent être « oubliées ».

Un autre problème concret est le coût. L'entrée d'1 million de tokens n'est pas gratuite — selon la tarification actuelle des API, remplir le contexte en une seule fois peut coûter de quelques dollars à plusieurs dizaines de dollars. Sans contrôle, un agent effectuant des dizaines de tours de conversation peut générer une facture de tokens très élevée.

Technologie Compaction

La Compaction API d'Anthropic et le mécanisme auto_compact de GPT-5.4 tentent de résoudre ce problème : lorsque le contexte est presque plein, le contenu initial est automatiquement compressé pour conserver les informations importantes. Théoriquement, cela peut prendre en charge des « conversations infiniment longues », mais l'effet réel dépend de la quantité d'informations perdues lors de la compression.

Une fenêtre de contexte plus longue n'est pas une fin en soi ; l'objectif est de maintenir un rappel précis des informations dans des contextes longs. Le point final de cette course aux armements n'est pas « qui a le plus grand nombre », mais « qui reste fiable dans des contextes extrêmement longs ».

Source de référence : Documentation officielle d'Anthropic, CocoLoop, rapports de lancement des modèles