Anthropic fait échanger des livres à 201 employés via Claude

L'équipe de recherche économique d'Anthropic a présenté le 24 septembre une expérience interne baptisée Project Swap : 201 employés, chacun muni d'un livre physique, ont d'abord discuté environ cinq minutes avec Claude de leurs goûts de lecture ; des agents pilotés par Claude ont ensuite négocié des échanges entre eux sur un marché numérique, avant que les livres échangés ne soient remis à leurs nouveaux propriétaires.

Les participants venaient de six bureaux — San Francisco, New York, Londres, Seattle, Washington D.C. et Dublin —, dont 115 à San Francisco et 57 à New York. Le marché a tourné pendant 205 tours au total, en comptant le tour initial et les répétitions de l'expérience.

Comment le marché a été conçu

L'espace d'échange suivait un modèle décentralisé de « libre échange » : les agents pouvaient troquer un contre un, ou réunir plusieurs parties pour former un cycle rotatif. Toutes les transactions conclues restaient visibles des participants et des autres agents. L'équipe de recherche a assigné aléatoirement deux types de consignes aux agents : les uns devaient défendre uniquement l'intérêt de leur propre mandant, les autres devaient aussi tenir compte du bien-être des autres pendant la négociation.

Deux références servaient de comparaison : une allocation optimale calculée pour maximiser l'utilité, et la règle des Top Trading Cycles, courante dans la conception de marchés.

Le point de blocage : comprendre la personne

Après la conversation de cinq minutes, Claude a classé tous les livres pour chaque participant. En comparant ce classement à celui établi par la personne elle-même, le taux de correspondance atteint 61 %. À titre de comparaison : deviner au hasard donne 50 %, classer par popularité environ 53 %, le filtrage collaboratif environ 55 %, et demander à un ami du participant de deviner atteint environ 57 %.

Le problème se situe plus en aval. Le livre effectivement reçu par les participants obtient, selon leur propre évaluation, une note moyenne de 0,55 — l'équivalent d'un cinquième rang sur dix livres —, alors que l'allocation théoriquement optimale atteindrait 0,89. L'équipe de recherche a décomposé cet écart : environ 85 % viennent du fait que Claude ne cerne pas assez précisément les préférences, contre seulement 15 % imputables à l'efficacité de négociation des agents.

"the market fell short mostly because of the information agents lacked about their participants, rather than because of how they traded"

(Le marché est resté en deçà de l'optimal principalement parce que les agents manquaient d'informations sur les participants, plutôt qu'à cause de leur façon de négocier.)

Une autre donnée le confirme : quand le volume de texte saisi par les participants doublait, la précision du classement gagnait environ 4 points de pourcentage. Plus la conversation était riche, mieux l'agent comprenait la personne.

La taille du modèle compte plus que la consigne

En évaluant l'efficacité des échanges sur la base du classement établi par Claude lui-même, Haiku 4.5 atteint 0,75, Sonnet 4.5 0,80, Opus 4.8 0,88 et Fable 5 0,86 ; l'optimum théorique selon ce même critère est de 0,95. Passer de Haiku à Opus apporte un gain d'efficacité de 0,12, tandis que l'écart entre les consignes « intérêt personnel uniquement » et « prise en compte des autres » n'est que de 0,02.

L'étude note aussi que lorsque des agents de capacités différentes cohabitent sur le même marché, les agents pilotés par des modèles plus faibles voient leurs performances nettement chuter. Les agents se montrent également prudents dans la divulgation d'informations pendant la négociation : entre 78 % et 96 % mentionnent le livre le plus désiré par leur mandant (Fable au plus bas, Sonnet au plus haut) ; le taux de mensonge sur le premier choix avoisine 1 % ; seuls environ 10 % acceptent de révéler un classement portant sur trois livres ou plus.

De l'épicerie de bureau au courtage de livres

En mettant bout à bout les expériences où Anthropic fait négocier Claude, on voit une évolution de la logique. Le Project Vend de 2025 laissait Claude gérer seul une épicerie de bureau, révélant surtout des failles de jugement commercial — prix fixés de façon arbitraire, remises cédées face à l'insistance des employés. Cette expérience d'échange de livres place les agents dans un marché à plusieurs parties, et l'enjeu devient « pour qui l'agent agit, et à quel point il connaît cette personne ».

Le résultat sert aussi d'avertissement pour ce type de produit : la négociation entre agents n'est déjà plus le maillon faible, l'étape la plus difficile reste la collecte des préférences en amont. Une conversation de cinq minutes peut surpasser le filtrage collaboratif, mais reste encore loin de « faire au mieux ».

Prêts à céder 30 % du budget

Lors du suivi trois semaines plus tard, les participants ont noté en moyenne 7,2 (sur 10) le livre reçu à l'échange, et se sont dits prêts à confier environ 30 % de leur budget annuel de livres à un agent ; à un ami de confiance, cette proportion monte à 40 %. Ceux qui estimaient que Claude n'avait manqué aucune information clé les concernant étaient prêts à céder 34 % du budget ; ceux qui pensaient le contraire, seulement 23 %.

Ces chiffres comportent des limites d'échantillon évidentes. Tous les participants étaient des employés d'Anthropic, naturellement plus enclins à faire confiance à Claude ; la participation à l'expérience n'offrait aucune incitation matérielle, si bien que le classement n'a pas forcément été fait avec le plus grand sérieux ; la version de Claude testée était elle-même ajustée vers la politesse et la coopération, et des paramètres comme la durée du marché, le nombre de participants ou le mode d'inscription n'ont pas été modifiés à des fins de comparaison. Le taux final de réponse à l'enquête n'était que de 59 %, et les chiffres de satisfaction comme de budget ne proviennent que de ce sous-groupe — ce qu'il en serait pour des consommateurs ordinaires reste, à ce stade, sans données.

Sources : rapport Project Swap sur le blog de recherche d'Anthropic, CocoLoop ; vérifiés : le nombre de participants, le taux de correspondance des classements, les scores d'allocation, l'efficacité d'échange de chaque modèle et le taux de délégation du budget.