Fable 5.1 : le tarif de lecture du cache divisé par quatre

Anthropic a mis en ligne Claude Fable 5.1, identifiant de modèle claude-fable-5-1, disponible en même temps sur la Claude API ainsi que via Bedrock, Google Cloud et Microsoft Foundry. Mythos 5.1, aux spécifications et tarifs identiques, sort au même moment, mais reste réservé aux clients invités pour l'instant.

La base reste celle de la génération précédente : fenêtre de contexte d'un million de tokens facturée de façon uniforme, sortie maximale de 128 000 tokens, raisonnement adaptatif activé par défaut, une date de connaissances fiable arrêtée à juin 2026.

Tout le tableau tarifaire n'a changé que sur une seule case

10 dollars l'entrée, 50 dollars la sortie par million de tokens, identique à la génération précédente ; le prix d'écriture du cache non plus n'a pas bougé. Seule la lecture du cache change : Fable 5.1 la facture à 0,025 fois le prix de base de l'entrée, soit 0,25 dollar par million de tokens ; pour les autres modèles Claude, le facteur est de 0,1.

Cette baisse ne joue que pour un seul type d'usage : quand le même segment de préfixe est relu à répétition. Calcul rapide : un prompt système plus un préfixe de base de code totalisant 200 000 tokens, relu 100 fois au cours d'une session d'agent de plusieurs heures, cela fait 20 millions de tokens de lecture de cache — 20 dollars à l'ancien tarif, 5 dollars au nouveau. Le prix d'écriture et la longueur minimale cachable de 512 tokens restent inchangés ; toute l'économie vient de cette seule action de « relecture ».

Les agents de long cours sont justement le scénario où la relecture est la plus intense. Placer la baisse précisément sur cette case envoie un signal assez clair.

Trois changements qui déclenchent directement une erreur

Ceux qui migrent depuis la génération précédente en se contentant de changer l'identifiant du modèle, sans toucher au code, vont rencontrer des problèmes.

L'appel d'outil forcé est supprimé. Régler tool_choice sur any ou forcer un outil précis renvoie directement une erreur 400. L'explication officielle est que, le raisonnement de ce modèle étant toujours actif, un appel forcé sauterait le raisonnement, et le modèle finirait par écrire son processus de déduction dans les paramètres de l'outil, ce qui dégraderait leur qualité. Pour obtenir un JSON structurellement valide, il faut désormais utiliser le mode strict ou les sorties structurées.

Les blocs de raisonnement reconnaissent désormais leur modèle d'origine. Chaque bloc de raisonnement enregistre le modèle qui l'a produit et ne peut être transmis que dans un seul sens : Fable 5.1 sait lire les blocs de raisonnement des modèles précédents, mais pas l'inverse. Quand une session monte en version, la chaîne de raisonnement est conservée ; quand elle redescend, le raisonnement de ces échanges est perdu. Lors d'un routage ou d'un fallback qui change de modèle en cours de session, l'API écarte silencieusement les blocs illisibles, sans les facturer et, par défaut, sans le signaler.

Modifier l'historique invalide tous les blocs de raisonnement qui suivent. Toucher à quoi que ce soit avant un bloc de raisonnement — prompt système, tableau d'outils, un message antérieur — fait renvoyer une erreur 400 à la requête suivante. Cette règle s'applique de façon obligatoire aux comptes créés à partir du 31 août. Le piège le plus courant consiste à injecter un rappel temporaire dans l'historique à chaque tour puis à le retirer au tour suivant, ou à reconstruire le prompt système entre deux requêtes. Les utilisateurs des clients officiels n'ont rien à faire ; ce sont les intégrations qui assemblent elles-mêmes le tableau de messages qui doivent vérifier.

Ce qu'on économise sur l'entrée peut revenir par la sortie

Plus important que les changements qui cassent le code, il y a les changements de comportement par défaut qui surviennent d'eux-mêmes, sans toucher au code. Anthropic en liste sept au total, dont trois touchent directement à la facture.

D'abord, les appels d'outils en parallèle deviennent moins fiables : là où la génération précédente envoyait plusieurs appels groupés en un tour, 5.1 peut n'en envoyer qu'un seul par tour — la documentation affirme que la qualité des réponses ne baisse pas, mais davantage de tours consomment davantage de tokens et d'allers-retours. Ensuite, le modèle a davantage tendance à réécrire un fichier entier ; le résultat est généralement le même, mais la dépense supplémentaire porte sur les tokens de sortie. Enfin, à faible niveau d'effort, le modèle recourt moins à la recherche et répond davantage de mémoire.

En mettant ces points en regard du tableau tarifaire, ce que fait 5.1 relève moins d'une baisse de prix que d'un déplacement du coût de l'entrée vers les tours d'échange. La lecture du cache est trois quarts moins chère, mais des appels d'outils plus morcelés et des réécritures de fichiers entiers pèsent sur le prix de sortie de 50 dollars par million, cinq fois plus cher que l'entrée. Que la facture grimpe ou baisse dépend de ce qui pèse le plus dans la boucle d'agent concernée : relire le contexte à répétition ou produire du contenu à répétition. Relancer une évaluation après la migration et vérifier la facture au passage reste une étape incontournable.

Parmi les quatre nouvelles fonctions bêta, deux — ajuster le niveau d'effort en cours de session et un message système valable pour un seul tour — sont justement conçues pour contourner ces pièges. S'y ajoute un marquage de contenu activé par défaut : le texte généré porte un filigrane statistique sur toutes les plateformes, et les images et vidéos récupérées portent des identifiants C2PA.

L'écart de benchmark le plus marqué concerne l'agent de recherche scientifique

Dans la comparaison officielle publiée, les progrès varient beaucoup d'un test à l'autre :

BenchmarkFable 5.1Fable 5Opus 5GPT-5.6 Sol
Terminal-Bench-Science 0.1 (agentic scientific research)52.6%24.7%29.0%22.4%
Terminal-Bench 4.0 (agentic coding)55.8%42.0%52.3%37.3%
GDPval-AA v2 (knowledge work, score)1853172318241711
OSWorld 2.0 (computer use, partial / strict)77.9% / 41.7%72.9% / 36.1%75.4% / 39.6%
Humanity's Last Exam (no tools / with tools)60.9% / 65.0%57.8% / 63.8%56.6% / 63.6%
AutomationBench (business workflows)31.4%17.1%26.9%19.6%
CursorBench 3.2.0 (agentic coding)73.4%70.5%70.0%67.2%

L'écart le plus marqué concerne l'agent de recherche scientifique : 52,6 % contre 24,7 % pour la génération précédente, plus du double. C'est aussi le seul point où la génération précédente était nettement derrière Opus 5 (24,7 % contre 29,0 %) — 5.1 comble cette faiblesse plutôt que de progresser uniformément partout. La colonne des processus métiers suit le même schéma, 31,4 % contre 17,1 %. Mythos 5.1 annonce séparément 60,9 % sur Terminal-Bench 4.0.

À l'inverse, sur les tâches courantes, le tableau change : CursorBench passe de 70,5 % à 73,4 %, seulement 2,9 points de plus ; Humanity's Last Exam avec outils gagne 1,2 point ; en travail de connaissance, 1853 contre 1824 pour Opus 5, un écart de 29 points. Ces chiffres concordent avec la section tarifaire — payer le double achète de la capacité pour les tâches longues et difficiles, tandis que l'écart sur le codage quotidien et les réponses courantes est trop faible pour justifier le prix. La recommandation officielle va dans le même sens : la majorité des charges de travail devraient encore partir d'Opus 5, Fable 5.1 étant réservé au raisonnement de haute difficulté et aux agents de long cours. L'écart de prix parle de lui-même — Opus 5 est à 5 et 25 dollars, et reste plus rapide.

Sources : documentation des modèles Anthropic, CocoLoop, page des notes de version ; les prix, les spécifications de contexte et les changements majeurs ont été vérifiés selon ce que révèle la documentation officielle ; le coût des sessions longues est une estimation approximative fondée sur les tarifs publics.