Anthropic讓Claude替201人換書

Anthropic 經濟研究團隊 9 月 24 日公布一項名為 Project Swap 的內部實驗:201 名員工各自帶來一本實體書,先與 Claude 聊約五分鐘,說說自己喜歡看什麼書;接著由 Claude 驅動的代理人在一個數位市集裡互相議價換書,最後把換到的書交到本人手上。

參與者分布在舊金山、紐約、倫敦、西雅圖、華盛頓特區與都柏林六個辦公室,其中舊金山 115 人、紐約 57 人。整個市集前後跑了 205 輪,含首輪與重複實驗。

市集怎麼設計

交易採去中心化的「自由交易」模式,代理人可以一對一互換,也能拉幾方組成循環交易。所有成交紀錄對參與者與其他代理人公開。研究團隊隨機給代理人分派兩種指示:一種只替自己的主人爭取利益,另一種在談判時也會顧及其他人的福祉。

用來對照的有兩套標準答案:一套是依效用最大化算出的最佳配置,另一套是市場設計中常見的「頂級交易循環」(Top Trading Cycles)規則。

卡在「摸清對方」這一步

五分鐘對話結束後,Claude 為每位參與者排出全部書籍的順序。把這份順序拿去跟本人自己排的順序逐一比對,一致率是 61%。作為對照,隨機猜是 50%,按熱門度排約 53%,協同過濾約 55%,找參與者的朋友來猜約 57%。

問題出在後段。參與者最後拿到的書,依本人自己的評分平均只有 0.55 分,大約等於十本書裡排第五名;理論最佳配置能做到 0.89 分。研究團隊把這段落差拆解後發現,約 85% 是 Claude 沒能準確掌握偏好造成的,只有約 15% 出在代理人談判效率上。

the market fell short mostly because of the information agents lacked about their participants, rather than because of how they traded

(意思是:市集之所以沒有達到最佳結果,主要原因是代理人對參與者的了解不夠,而不是談判手法的問題。)

另一項數據也能佐證這點:參與者輸入的文字量增加一倍,排序準確率大約能提升 4 個百分點。聊得越多,代理人就越懂這個人。

模型大小比指示內容更關鍵

以 Claude 自己排出的順序為基準來看交易效率,Haiku 4.5 是 0.75,Sonnet 4.5 是 0.80,Opus 4.8 是 0.88,Fable 5 是 0.86,這個口徑下的理論最佳值是 0.95。從 Haiku 換成 Opus,效率提升 0.12;「只顧自己」跟「兼顧他人」這兩種指示之間的差距只有 0.02。

研究還提到,當不同能力的代理人混在同一個市集裡,由較弱模型驅動的代理人表現會明顯下滑。代理人在談判中對資訊的揭露也相當謹慎:78% 到 96% 的代理人會提到主人最想要的書,Fable 最低、Sonnet 最高;在首選上說謊的比例約 1%;願意透露三本以上排序的只有 10%。

從開小福利社到幫人換書

把 Anthropic 這幾次「讓 Claude 下場做生意」的實驗串起來看,重點其實一直在變。2025 年的 Project Vend 讓 Claude 獨自經營辦公室裡的小福利社,暴露出來的多半是經營判斷問題,比如定價隨性、被員工軟磨硬泡就打折。這次換書實驗把代理人放進多方市集,測試重點換成了「替誰辦事、對這個人了解多少」。

結果也給這類產品提了個醒:代理人之間的談判已經不算是弱點,最難的一關仍然是前端的偏好蒐集。五分鐘的對話能贏過協同過濾,但離「把事情辦到最好」還有一段距離。

願意交出三成預算

三週後的回訪中,參與者對換到的書平均打了 7.2 分(滿分 10 分),並表示願意把約 30% 的年度買書預算交給代理人打理;如果是交給信得過的朋友,這個比例是 40%。覺得 Claude 沒漏掉自己關鍵資訊的人,願意交出 34% 的預算;覺得有漏掉的人則只願意給 23%。

這些數字有明顯的樣本侷限。參與者全是 Anthropic 員工,本來就比較信任 Claude;參加實驗沒有實質獎勵,排序時未必認真看待;測試的也只是經過禮貌、合作取向調校過的 Claude 版本;市集的運作時長、人數、報名方式等參數也都沒有變動過。最終問卷的完成率只有 59%,滿意度與預算比例都只來自這批人,換成一般消費者會是什麼結果,目前還沒有數據。

參考來源:Anthropic 研究部落格 Project Swap 報告、CocoLoop;核驗參與人數、排序一致率、配置得分、各模型交易效率與預算委託比例。