Anthropicの経済調査チームは9月24日、「Project Swap」と呼ばれる社内実験の結果を公表した。201人の社員がそれぞれ1冊の実物の本を持ち寄り、まずClaudeと5分ほど会話して自分の好みを伝える。その後、Claudeが動かすエージェント同士がデジタル市場で交渉して本を交換し、交換で得た本を本人に手渡すという内容だ。
参加者はサンフランシスコ、ニューヨーク、ロンドン、シアトル、ワシントンD.C.、ダブリンの6拠点にまたがり、サンフランシスコが115人、ニューヨークが57人を占めた。市場は初回と再実験を合わせて計205ラウンド実施された。
市場の仕組み
取引の場は分散型の「自由取引」方式で、エージェントは1対1で交換するほか、複数者を巻き込んだ循環取引を組むこともできた。成立した取引はすべて参加者や他のエージェントに公開される。研究チームはエージェントにランダムで2種類の指示のいずれかを与えた。1つは自分の持ち主の利益だけを追求するもの、もう1つは交渉の中で他者の利益にも配慮するものだ。
比較対象として2つの基準を用意した。1つは効用最大化に基づく最適配分、もう1つは市場設計の分野でよく使われる「トップ・トレーディング・サイクル」(Top Trading Cycles)方式だ。
つまずいたのは「相手を理解する」段階
5分間の会話の後、Claudeは各参加者について全ての本の順位を作成した。この順位を本人自身の順位と1対1で比較したところ、一致率は61%だった。参考までに、ランダムな推測では50%、人気順では約53%、協調フィルタリングでは約55%、参加者の友人に推測してもらった場合は約57%となっている。
問題は下流の工程で起きていた。参加者が実際に受け取った本を本人基準で採点すると平均0.55点で、10冊の本の中でおよそ5位に相当する水準にとどまった。理論上の最適配分なら0.89点を達成できる。研究チームがこのギャップを分解したところ、約85%はClaudeが好みを正確に把握できていないことに起因し、エージェントの交渉効率に起因するのは約15%にすぎなかった。
the market fell short mostly because of the information agents lacked about their participants, rather than because of how they traded
(市場が最適に届かなかった主な原因は、エージェントが交渉のやり方ではなく、参加者について十分な情報を持っていなかったことにある。)
もう一つのデータもこれを裏付ける。参加者が入力した文字量が2倍になると、順位の一致率はおよそ4ポイント向上した。会話量が多いほど、エージェントは相手をより理解できるということだ。
指示内容よりモデルサイズが重要
Claude自身が作成した順位を基準に取引効率を見ると、Haiku 4.5が0.75、Sonnet 4.5が0.80、Opus 4.8が0.88、Fable 5が0.86で、この指標における理論上の最適値は0.95だった。HaikuからOpusに切り替えると効率は0.12向上する一方、「自分の利益だけを追求」と「他者にも配慮」という2種類の指示による差はわずか0.02にとどまった。
研究ではさらに、能力の異なるエージェントが同じ市場に混在すると、弱いモデルで動くエージェントの成績が明らかに低下することも示された。エージェントは交渉中の情報開示にも慎重で、持ち主が最も欲しがっている本に言及したエージェントは78%〜96%(最低はFable、最高はSonnet)。最も欲しい本について嘘をついた割合は約1%、3冊以上の順位を明かしたエージェントはわずか10%だった。
「売店経営」から「本の交換代行」へ
AnthropicがこれまでClaudeを商取引の現場に投入してきた一連の実験をつなげてみると、着眼点が変化していることが分かる。2025年の「Project Vend」ではClaudeが単独でオフィス内の売店を運営し、価格設定の一貫性のなさや社員に粘られて値引きしてしまうといった、経営判断上の問題が主に浮き彫りになった。今回の本交換実験ではエージェントを多者間の市場に置き、検証の焦点は「誰のために動き、その相手をどれだけ理解しているか」に移った。
この結果は、この種のプロダクトに対する警鐘にもなっている。エージェント同士の交渉自体はもはや弱点ではなく、最も難しいのは依然として前段階の好み収集だ。5分間の会話は協調フィルタリングを上回る成果を出せるものの、「最善の結果」にはまだ遠い。
予算の3割を委ねてもよいという声
3週間後に実施した追跡調査では、参加者は交換で得た本に平均7.2点(10点満点)を付け、年間の書籍購入予算のうち約30%をエージェントに任せてもよいと回答した。信頼できる友人に任せる場合は40%だった。Claudeが自分の重要な情報を見落としていないと感じた参加者は34%の予算を委ねる意向を示したのに対し、見落としがあったと感じた参加者は23%にとどまった。
これらの数値には明確なサンプル上の制約がある。参加者は全員Anthropicの社員であり、Claudeへの信頼度がもともと高い。実験参加に金銭的なインセンティブはなく、順位付けを真剣に行ったとは限らない。テストされたのは、丁寧で協調的な方向に調整された特定のバージョンのClaudeのみだ。市場の稼働時間や参加人数、登録方法といったパラメータも変更されていない。最終アンケートの回答率は59%にとどまり、満足度や予算委任の割合はこの層のデータに基づくため、一般消費者に当てはめた場合にどうなるかは現時点で分かっていない。
参考資料:Anthropic Research Blog「Project Swap」レポート、CocoLoop(参加人数、順位一致率、配分スコア、モデル別取引効率、予算委任比率を検証)。