Das Wirtschaftsforschungsteam von Anthropic stellte am 24. September ein internes Experiment namens Project Swap vor: 201 Mitarbeitende brachten je ein gedrucktes Buch mit, sprachen zunächst rund fünf Minuten mit Claude über ihren Lesegeschmack, und anschließend handelten von Claude gesteuerte Agenten in einem digitalen Marktplatz Tauschgeschäfte untereinander aus, bevor die eingetauschten Bücher an die jeweiligen Personen übergeben wurden.
Die Teilnehmenden verteilten sich auf sechs Standorte – San Francisco, New York, London, Seattle, Washington D.C. und Dublin –, davon 115 in San Francisco und 57 in New York. Der Markt lief über insgesamt 205 Runden, einschließlich der ersten Runde und wiederholter Durchläufe.
Wie der Markt aufgebaut war
Der Handelsplatz folgte einem dezentralen Modell des freien Tauschs: Agenten konnten eins-zu-eins tauschen oder mehrere Parteien zu einem Tauschring zusammenschließen. Alle abgeschlossenen Geschäfte waren für Teilnehmende und andere Agenten einsehbar. Das Forschungsteam wies den Agenten nach dem Zufallsprinzip zwei Arten von Anweisungen zu: Die einen sollten ausschließlich die Interessen ihres eigenen Auftraggebers vertreten, die anderen sollten beim Verhandeln auch das Wohl der anderen berücksichtigen.
Als Vergleichsmaßstäbe dienten zwei Referenzlösungen: eine nutzenmaximierende optimale Zuteilung sowie die in der Marktdesign-Forschung gängige Top-Trading-Cycles-Regel.
Der Engpass: den Menschen verstehen
Nach dem fünfminütigen Gespräch erstellte Claude für jede teilnehmende Person ein Ranking sämtlicher Bücher. Im Vergleich mit deren eigenem Ranking lag die Übereinstimmung bei 61 %. Zum Vergleich: Zufälliges Raten kommt auf 50 %, ein Ranking nach Beliebtheit auf etwa 53 %, Collaborative Filtering auf etwa 55 %, und Freundinnen und Freunde der Teilnehmenden erreichten beim Raten rund 57 %.
Das eigentliche Problem zeigte sich weiter unten in der Kette: Das Buch, das die Teilnehmenden am Ende erhielten, bewerteten sie selbst im Schnitt nur mit 0,55 – etwa Rang fünf von zehn Büchern –, während die theoretisch optimale Zuteilung 0,89 erreicht hätte. Das Forschungsteam schlüsselte diese Lücke auf: rund 85 % gehen darauf zurück, dass Claude die Vorlieben nicht präzise genug erfasste, nur etwa 15 % auf die Verhandlungseffizienz der Agenten.
"the market fell short mostly because of the information agents lacked about their participants, rather than because of how they traded"
(Der Markt blieb vor allem deshalb hinter dem Optimum zurück, weil den Agenten Informationen über die Teilnehmenden fehlten – nicht wegen der Art, wie sie verhandelten.)
Ein weiterer Befund stützt das: Verdoppelte sich die von den Teilnehmenden eingegebene Textmenge, stieg die Ranking-Genauigkeit um etwa 4 Prozentpunkte. Je mehr gesprochen wurde, desto besser verstanden die Agenten die jeweilige Person.
Modellgröße zählt mehr als die Anweisung
Gemessen an der Handelseffizienz auf Basis von Claudes eigenem Ranking erreichte Haiku 4.5 einen Wert von 0,75, Sonnet 4.5 0,80, Opus 4.8 0,88 und Fable 5 0,86; das theoretische Optimum liegt in dieser Betrachtung bei 0,95. Der Wechsel von Haiku zu Opus brachte einen Effizienzgewinn von 0,12, während der Unterschied zwischen den Anweisungen „nur Eigeninteresse“ und „Rücksicht auf andere“ lediglich 0,02 betrug.
Die Studie zeigt außerdem: Treffen unterschiedlich leistungsfähige Agenten im selben Markt aufeinander, schneiden die von schwächeren Modellen gesteuerten Agenten deutlich schlechter ab. Auch bei der Offenlegung von Informationen während der Verhandlung agierten die Agenten zurückhaltend: 78 bis 96 % erwähnten das von ihrem Auftraggeber meistgewünschte Buch (Fable am niedrigsten, Sonnet am höchsten); über die Top-Präferenz logen sie in etwa 1 % der Fälle; nur rund 10 % waren bereit, ein Ranking von drei oder mehr Büchern preiszugeben.
Vom Kioskbetrieb zum Bücher-Vermittler
Reiht man Anthropics bisherige Experimente ein, in denen Claude selbst am Markt agiert, zeigt sich ein Kurswechsel. Im Project Vend von 2025 betrieb Claude allein einen Bürokiosk und offenbarte dabei vor allem unternehmerische Schwächen, etwa willkürliche Preissetzung oder Rabatte, die sich Mitarbeitende erschmeicheln konnten. Das Buchtausch-Experiment versetzt die Agenten nun in einen Markt mit vielen Parteien – der Schwerpunkt verschiebt sich auf die Frage, für wen ein Agent handelt und wie gut er diese Person kennt.
Das Ergebnis ist zugleich eine Mahnung für diese Art von Produkten: Die Verhandlung zwischen Agenten ist längst kein Engpass mehr – am schwierigsten bleibt die Erfassung von Vorlieben am Anfang der Kette. Ein fünfminütiges Gespräch schlägt zwar Collaborative Filtering, liegt aber noch weit von einem optimalen Ergebnis entfernt.
Bereit, ein Drittel des Budgets abzugeben
In der Nachbefragung drei Wochen später bewerteten die Teilnehmenden das eingetauschte Buch im Schnitt mit 7,2 von 10 Punkten und erklärten sich bereit, rund 30 % ihres jährlichen Buchbudgets einem Agenten anzuvertrauen; einer vertrauenswürdigen Freundin oder einem Freund würden sie hingegen 40 % überlassen. Wer der Meinung war, Claude habe keine wichtigen Informationen über die eigene Person übersehen, war bereit, 34 % des Budgets abzugeben; wer glaubte, es sei etwas übersehen worden, nur 23 %.
Diese Zahlen unterliegen deutlichen Stichprobengrenzen: Alle Teilnehmenden waren Anthropic-Mitarbeitende, die Claude ohnehin stärker vertrauen; für die Teilnahme gab es keinen materiellen Anreiz, weshalb das Ranking nicht zwangsläufig sorgfältig ausfiel; getestet wurde zudem nur eine auf Höflichkeit und Kooperationsbereitschaft getrimmte Claude-Version, und Parameter wie Marktdauer, Teilnehmerzahl oder Anmeldeverfahren wurden nicht variiert. Die abschließende Umfrage hatten nur 59 % vollständig beantwortet, und Zufriedenheits- wie Budgetwerte stammen ausschließlich aus dieser Teilgruppe – wie sich das Ganze bei gewöhnlichen Verbraucherinnen und Verbrauchern verhalten würde, ist bislang unbekannt.
Quellen: Anthropic-Forschungsblog, Bericht zu Project Swap, CocoLoop; geprüft wurden Teilnehmerzahl, Ranking-Übereinstimmung, Zuteilungswerte, Handelseffizienz der einzelnen Modelle sowie die Budget-Delegationsquote.