Microsoft et Hugging Face ont présenté conjointement le cadre d'évaluation d'agents ThinkingBox ainsi que le benchmark qui l'accompagne, ThinkingBox-Bench. Le critère de notation ne repose pas sur le fait que l'agent déclare lui-même avoir « terminé », mais sur l'état réel de la base de données du backend une fois le travail de l'agent achevé.
Le benchmark comprend 507 tâches de processus métier avec état, réparties sur cinq secteurs : commerce de détail (98), assurance automobile (100), voyage (104), banque numérique (104) et conseil (101). Chaque tâche est exécutée indépendamment 20 fois sur un backend propre, avec des scripts de vérification exécutables qui contrôlent l'état final de la base de données et les effets de bord — par exemple si le champ censé être modifié l'a bien été correctement, ou si un enregistrement qui ne devait pas être touché a été modifié par erreur.
“The Agent Said It Was Done. The Database Disagreed.”
(L'agent a dit avoir terminé. La base de données n'était pas d'accord.)
Les résultats des 18 modèles
18 modèles ont participé à l'évaluation, qu'ils soient à code source fermé ou à poids ouverts. Selon le critère « réussite sur les 20 exécutions », Claude Opus 5.5 et Claude Opus 5 sont ex æquo en tête, résolvant chacun de façon stable 241 tâches, soit 47,53 % ; GPT-6 Astra arrive troisième avec 231 tâches, soit 45,56 %. En d'autres termes, même le meilleur modèle n'arrive pas à être parfaitement constant sur plus de la moitié des tâches.
Le modèle avec la couverture la plus large est Kimi-K3 : sur 507 tâches, 476 ont été résolues correctement au moins une fois, soit un taux de 93,89 %. Mais il n'a réussi les 20 exécutions complètes que sur 68 tâches. Pour un même modèle, le score selon pass@20 paraît presque sans limite, alors qu'il recule nettement en stabilité — les deux chiffres diffèrent d'un facteur sept.
Les statistiques sur les causes d'échec sont plus précises encore. Sur 79 853 tentatives « terminées normalement mais avec un résultat erroné », 77,61 % comportaient des valeurs de champ mal écrites et 43,30 % ont provoqué des effets de bord inattendus (les deux catégories peuvent se cumuler). L'équipe estime qu'environ 80 % des échecs se situent au niveau de l'appel d'outils, par exemple des paramètres mal transmis ou un ordre d'appel incorrect, la part d'erreurs de raisonnement proprement dites étant plus faible.
L'équipe a aussi calculé le « coût par tâche fiable », c'est-à-dire la dépense moyenne nécessaire pour accomplir une tâche de façon stable sur 20 exécutions : 6,80 dollars pour GPT-5.4, 7,45 dollars pour GPT-6 Astra, 7,80 dollars pour Claude Opus 5.5. La génération précédente, GPT-5.4, se classe devant les modèles plus récents sur cet indicateur.
Comparaison avec les benchmarks d'agents existants
Mesurer la stabilité sur plusieurs exécutions n'est pas une idée inédite de ThinkingBox. Le τ-bench, publié par Sierra en 2024, proposait déjà la métrique pass^k, exigeant que le modèle réussisse k fois de suite la même tâche, à l'époque limitée aux secteurs du commerce de détail et de l'aviation. La différence de ThinkingBox tient à l'échelle et au critère d'évaluation : le nombre de tâches passe à 507, le nombre de secteurs à cinq, et les effets de bord deviennent une condition d'échec à part entière. Selon la logique du τ-bench, un agent qui modifie en plus un enregistrement sans rapport n'est pas forcément pénalisé.
Ce site avait déjà couvert le benchmark Vero de Berkeley, où les agents devaient mener à bien 43 projets logiciels, le meilleur résultat étant de 27 projets achevés — une mesure de « l'ampleur de ce qu'on peut accomplir en une seule fois ». ThinkingBox va dans la direction inverse : la tâche elle-même n'est pas difficile, ce qui compte est de savoir si, en répétant la même chose 20 fois, un passage échoue. Dans les processus d'entreprise, ce second type d'erreur est souvent plus grave — modifier une seule fois par erreur le montant d'une police d'assurance ou un champ de virement coûte, à corriger, bien plus cher qu'une tâche simplement inachevée.
Comment l'utiliser
Le code est ouvert sous licence MIT, les données du benchmark sont sous CDLA-Permissive-2.0, et l'environnement OpenEnv sous BSD-3-Clause ; il peut être exécuté directement via l'interface OpenEnv sur Hugging Face. Un déploiement local nécessite Docker et Typesense pour gérer l'état, les outils sont fournis via un serveur MCP, et il faut configurer trois points de terminaison de modèle : l'agent testé, l'utilisateur simulé et le modèle juge.
L'utilisateur simulé et le juge sont tous deux interprétés par des modèles, ce qui peut en soi introduire des erreurs. Le billet de blog ne précise pas séparément le taux de concordance entre le modèle juge et une annotation humaine — en l'absence de cette donnée, les écarts d'un ou deux points de pourcentage entre modèles ne devraient pas être surinterprétés. Des stagiaires de l'université de Pittsburgh, de l'UC Irvine, de l'université Northwestern et de l'université Columbia ont également participé au projet.
Sources : blog Hugging Face, Microsoft Research, CocoLoop, article τ-bench de Sierra ; le nombre de tâches résolues par chaque modèle, la proportion des types d'échec et le coût par tâche suivent les chiffres publiés par l'équipe ThinkingBox.