Opus 4.6 publié : le modèle décide lui-même s'il doit réfléchir en profondeur

Le 5 février, Anthropic a publié Opus 4.6, dont l'amélioration principale s'appelle Adaptive Thinking (Pensée Adaptative).

Avant vs. Maintenant

Auparavant, avec extended thinking, il fallait définir manuellement un budget — décider si le modèle devait réfléchir 10 ou 30 secondes relevait uniquement du développeur. Désormais, Opus 4.6 décide lui-même :

  • Questions simples → réponse immédiate, sans gaspiller de puissance de calcul
  • Questions complexes → activation automatique du mode de raisonnement profond
  • Ressources de calcul allouées selon les besoins

Le principe sous-jacent est que le modèle effectue une évaluation de la difficulté dès qu'il reçoit le prompt, puis ajuste dynamiquement la profondeur du raisonnement. Quatre niveaux de réglage manuel sont proposés (low/medium/high/max), avec high par défaut.

Fenêtre de contexte maximale

  • Contexte : 1 million de tokens (bêta)
  • Sortie maximale : 128K tokens
  • Précision de récupération MRCR v2 : 93 % dans un contexte de 256K, encore 76 % à 1 million

À titre de comparaison, la fiabilité de récupération de Sonnet 4.5 dans le même test n'est que d'un quart à un neuvième de celle d'Opus 4.6. L'écart est considérable.

Améliorations notables dans les scénarios d'agent

BenchmarkScore
Terminal Bench59,8 % → 65,4 %
OSWorld66,3 % → 72,7 %

Les deux résultats dépassent GPT-5.2 et Gemini 3 Pro.

Une autre fonction puissante est la Compaction API — elle compresse automatiquement l'historique de la conversation côté serveur, prenant en charge théoriquement des conversations de longueur infinie. Dans les scénarios d'agent qui exécutent des dizaines de tours d'interaction pour accomplir des tâches de programmation complexes, cette capacité détermine directement le taux de réussite de la tâche.

Sources de référence : Article de The New Stack sur Opus 4.6, CocoLoop, documentation officielle d'Anthropic