Fable 5.1 en tête de l'indice d'intelligence, 3.69 dollars par tâche

L'organisme d'évaluation indépendant Artificial Analysis a publié de nouveaux résultats pour Claude Fable 5.1 : indice global d'intelligence de 66 points, premier rang parmi 192 modèles testés. La génération précédente, Fable 5, obtenait 62 points et se classait sixième.

Le même jeu de résultats contient une autre série de chiffres. Pour exécuter l'intégralité de la batterie d'évaluation de l'indice d'intelligence, Fable 5.1 a coûté 8523.16 dollars, contre 5455.22 dollars pour Fable 5 ; ramené au coût d'une seule tâche, le montant est passé de 3.14 à 3.69 dollars.

Le prix au token n'a pas bougé, mais le modèle parle davantage

Les prix affichés des deux générations sont strictement identiques : 10 dollars par million de tokens en entrée, 50 dollars par million de tokens en sortie. Les plus de trois mille dollars supplémentaires proviennent entièrement de la longueur des réponses — Fable 5 a généré 83 millions de tokens en sortie pour l'ensemble des tests, Fable 5.1 en a généré 140 millions, soit une hausse d'environ 69 %. Artificial Analysis indique une médiane de 71 millions de tokens, ce qui signifie que le volume de sortie de 5.1 avoisine le double de cette médiane.

Cela correspond à la tendance générale des modèles de raisonnement observée depuis un an : les gains de capacité viennent du fait que le modèle réfléchit en davantage d'étapes, mais la facturation se fait au token, donc la note augmente avec la durée du raisonnement. Pour un utilisateur en abonnement mensuel, l'impact n'est pas direct ; pour les équipes facturées à l'API, pour un même volume de tâches, le budget doit être recalculé.

Près de cinq minutes d'attente pour le premier token

La colonne vitesse attire encore plus l'attention. Fable 5.1 produit 66.4 tokens par seconde, se classant 84e sur 192 modèles, en dessous de la médiane de 70 ; le délai avant le premier token est de 296.81 secondes, contre 116.06 secondes pour la génération précédente — plus d'une fois et demie plus lent.

Ce chiffre de latence est pratiquement inutilisable dans un scénario interactif, mais il mesure l'ensemble du processus de raisonnement — le modèle réfléchit longtemps avant de produire le premier caractère. Sur une tâche de fond sans personne qui attend, cinq minutes ne posent pas de problème ; en attendant une suggestion de code dans un éditeur, c'est une autre histoire.

Face à GPT-5.6 Sol

Sur ce même classement, le GPT-5.6 Sol d'OpenAI obtient 61 points et se classe huitième, avec un coût de 2017.29 dollars pour l'ensemble des tests, 0.95 dollar par tâche, 70 millions de tokens générés en sortie, et des prix affichés de 4 dollars (entrée) et 20 dollars (sortie) par million de tokens.

Calcul rapide : Fable 5.1 obtient 5 points de plus à l'indice d'intelligence, mais coûte 3.9 fois plus cher par tâche et 4.2 fois plus cher pour l'ensemble des tests. Difficile d'en conclure lequel est le plus avantageux — les deux modèles ne répondent pas aux mêmes usages, et le temps gagné en réussissant du premier coup une tâche complexe peut très bien compenser cet écart de prix. Mais cela explique pourquoi de plus en plus d'équipes répartissent désormais leurs modèles par niveaux : les tâches difficiles vont au premier du classement, et les quatre-vingts pour cent de tâches courantes restantes vont à l'option la moins chère.

Le classement ne répond qu'à une question : qui est le plus intelligent. Celui qui paie la facture doit répondre lui-même à la seconde : combien vaut ce point supplémentaire.

Sources : page de comparaison des modèles d'Artificial Analysis, CocoLoop ; le score de l'indice d'intelligence, le coût total de l'évaluation, le coût par tâche, le volume de tokens en sortie et la latence du premier token proviennent tous du même passage de tests publics de cet organisme.