Claude Haiku 5.5 arrive avec une entrée à 0,10 dollar

Anthropic a lancé Claude Haiku 5.5 le 7 octobre, premier petit modèle de la génération Claude 5 — le précédent Haiku était resté à la version 4.5. Le nouveau modèle est arrivé le même jour sur la Claude Platform, ainsi que simultanément sur AWS, Google Cloud et Microsoft Azure; Claude Code l'a également intégré dans une mise à jour publiée ce jour-là.

Le positionnement officiel est très ciblé: les tâches par lots à haut débit, et le rôle de sous-agent pour les modèles plus grands. Le prix est la vedette de ce lancement.

Deux paliers tarifaires selon la longueur du prompt

Haiku 5.5 divise le prix en deux paliers selon la longueur de chaque prompt, avec 100 000 tokens comme seuil:

Par million de tokensHaiku 5.5 (≤100k)Haiku 5.5 (>100k)Haiku 4.5
Entrée0,10 $0,50 $1,00 $
Sortie0,50 $2,50 $5,00 $
Lecture cache0,01 $0,05 $0,10 $
Écriture cache0,125 $0,625 $1,25 $

Dans le palier court, tous les tarifs équivalent à un dixième de ceux de Haiku 4.5; dans le palier long, à la moitié. Selon Anthropic, le coût d'exploitation global baisse en moyenne d'environ 75%.

Les tarifs d'entrée et de sortie du palier court correspondent exactement à ceux de GPT-6 Luna, lancé par OpenAI fin septembre. Les petits modèles des deux entreprises sont désormais alignés sur la même grille tarifaire.

Le même jour, Anthropic a aussi réduit le prix de lecture du cache de Sonnet 5.5, de 0,20 à 0,10 dollar par million de tokens, et a offert des crédits API aux abonnés: Max 5x reçoit 100 dollars par mois, Max 20x reçoit 200 dollars, et le forfait Team dispose d'un total de 500 dollars pour toute l'équipe. Le développeur Simon Willison a écrit sur son blog que ces crédits ne sont pas reportés au mois suivant s'ils ne sont pas utilisés.

Scores de benchmark et paliers de raisonnement

Haiku 5.5 intègre un raisonnement activé par défaut qui ne peut pas être désactivé; on peut choisir parmi cinq paliers — low, medium, high, xhigh, max —, medium étant la valeur par défaut. Selon les chiffres officiels, le modèle a obtenu 72,4% sur le sous-ensemble hors ligne d'OSWorld 2.1, 39,2% sur Terminal-Bench 4.0, et sur Humanity's Last Exam 45,9% sans outils et 57,4% avec outils.

Plusieurs clients précoces ont publié leurs propres chiffres internes. Box indique que le nouveau modèle a obtenu 11 points de plus que Haiku 4.5 sur ses propres tests, avec une latence réduite de moitié environ:

"Claude Haiku 5.5 scored 11 points higher than Haiku 4.5 at about half the latency."

(Claude Haiku 5.5 a obtenu 11 points de plus que Haiku 4.5, avec une latence réduite de moitié environ.)

Asana a signalé une baisse de latence de plus de 30%, et HubSpot a déclaré avoir obtenu le meilleur score jamais vu dans ce test, 92,8%. Tous ces chiffres proviennent de tests réalisés par les clients eux-mêmes, sans que les questions utilisées aient été rendues publiques.

Le palier de raisonnement a un impact important sur le coût. Simon Willison a testé le même prompt — 'dessine un pélican à vélo' — au palier le plus bas et au plus élevé: le palier low a coûté environ 0,0009 dollar pour 7 secondes; le palier max a coûté environ 0,034 dollar pour 5 minutes 9 secondes, soit un écart de coût par exécution de plus de 30 fois.

Calcul rapide: le tokenizer absorbe une partie de la baisse de prix

Au-delà du tableau tarifaire, une variable facile à manquer entre en jeu. Simon Willison souligne que Haiku 5.5 a changé de tokenizer, et qu'un même passage de texte est désormais découpé en environ 1,25 fois plus de tokens que sur Haiku 4.5.

En calculant grossièrement avec ce facteur: le coût d'entrée réel au palier court équivaut à 0,125 dollar par million d'anciens tokens, contre 1 dollar pour Haiku 4.5, soit une baisse d'environ 87%, encore considérable. Au palier long, le tableau est moins flatteur: 0,50 dollar multiplié par 1,25 donne 0,625 dollar, et la baisse se réduit à environ 37%.

En ajoutant le raisonnement activé par défaut, les tokens de sortie seront plus nombreux que pour Haiku 4.5 sans raisonnement, l'écart exact dépendant du palier et de la tâche. Pour les équipes travaillant sur des tâches à entrée courte — benchmarks, extraction, routage —, changer de modèle revient pratiquement à économiser de l'argent directement; pour les scénarios avec documents longs et contexte étendu, mieux vaut d'abord tester son propre trafic avant de calculer la facture.

Sur le plan de la sécurité, Anthropic indique que les restrictions de Haiku 5.5 pour les demandes liées à la cybersécurité se situent entre celles de Haiku 4.5 et de Sonnet 5.5, tandis que les protections dans le domaine biologique sont équivalentes à celles de la série Sonnet 5; les recherches concernées nécessitent une demande de qualification de vérification séparée.

Sources: page produit Claude Haiku 5.5 d'Anthropic, blog de Simon Willison, CocoLoop, SiliconANGLE; le tableau tarifaire d'Anthropic a été vérifié pour les deux paliers et comparé à Haiku 4.5 pour les prix de cache, et la baisse du prix de lecture du cache de Sonnet 5.5 suit l'annonce officielle.