Anthropic让201名员工交给Claude换书

Anthropic 经济研究团队 9 月 24 日公布了一个叫 Project Swap 的内部实验:201 名员工每人带来一本实体书,先和 Claude 聊大约五分钟,说说自己爱读什么;随后由 Claude 驱动的代理在一个数字市场里互相议价换书,最后把换来的书交到本人手上。

参与者分布在旧金山、纽约、伦敦、西雅图、华盛顿特区和都柏林六个办公室,其中旧金山 115 人、纽约 57 人。整个市场前后跑了 205 轮,包括首轮和重复实验。

市场怎么搭

交易场是去中心化的“自由交易”模式,代理既可以一对一交换,也可以拉几方组成轮转。所有成交记录对参与者和其他代理公开。研究团队给代理随机分了两种指令:一种只替自己的主人争利益,另一种在谈判中兼顾别人的福利。

用来对照的有两套标准答案:一套是按效用最大化算出来的最优分配,另一套是市场设计里常用的顶级交易循环(Top Trading Cycles)规则。

卡在“懂人”这一步

五分钟对话之后,Claude 为每位参与者给所有书排了序。拿这份排序和本人自己的排序逐对比较,一致率是 61%。作为参照,随机猜是 50%,按流行度排约 53%,协同过滤约 55%,让参与者的朋友来猜约 57%。

问题出在下游。参与者最终拿到的书,在自己心目中的平均得分是 0.55,大约相当于十本书里排第五;理论最优分配能做到 0.89。研究团队把这段差距拆开,约 85% 来自 Claude 对偏好的把握不准,只有约 15% 算在代理谈判效率上。

“the market fell short mostly because of the information agents lacked about their participants, rather than because of how they traded” (市场没做到最优,主要是代理对参与者了解不够,谈判手法倒在其次。)

另一个数据能佐证这一点:参与者输入的文字量翻倍,排序准确率大约提升 4 个百分点。聊得越多,代理越懂人。

模型大小比指令更要紧

在 Claude 自己给出的排序基础上看交易效率,Haiku 4.5 为 0.75,Sonnet 4.5 为 0.80,Opus 4.8 为 0.88,Fable 5 为 0.86,这一口径下的理论最优是 0.95。从 Haiku 换到 Opus,效率提升 0.12;“只顾自己”和“兼顾他人”两种指令之间的差距只有 0.02。

研究还提到,不同能力的代理混在同一个市场里时,较弱模型驱动的代理表现会明显下滑。代理在谈判中的信息披露也很谨慎:78% 到 96% 的代理会提到主人最想要的书,Fable 最低、Sonnet 最高;在首选上说谎的比例约 1%;肯透露三本以上排序的只有 10%。

从开小卖部到替人换书

把 Anthropic 这几次“让 Claude 下场做买卖”的实验串起来看,思路在变。2025 年的 Project Vend 让 Claude 独自经营办公室里的小卖部,暴露的多是经营判断问题,比如定价随意、被员工软磨硬泡就打折。这次换书实验把代理放进多方市场,测的重点换成了“替谁办事、对他了解多少”。

结果也给这类产品提了一个醒:代理之间的谈判已经不算短板,最难的一环仍在前端的偏好采集。五分钟聊天能赢过协同过滤,但离“把事办到最好”还差得远。

愿意交出三成预算

三周后的回访里,参与者对换到的书平均打分 7.2(满分 10),并表示愿意把约 30% 的年度购书预算交给代理打理;交给信得过的朋友,这个比例是 40%。觉得 Claude 没漏掉自己关键信息的人,愿意交出 34% 的预算;觉得有遗漏的人只给 23%。

这些数字有明显的样本局限。参与者全是 Anthropic 员工,天然更信任 Claude;参加实验没有物质激励,排序时未必认真;测试的只是经过礼貌、合作方向调校的 Claude 版本;市场运行时长、人数、登记方式等参数也没有改动过。最终调查的完成率只有 59%,满意度和预算比例都来自这部分人,放到普通消费者身上会怎样,目前没有数据。

参考来源:Anthropic 研究博客 Project Swap 报告、CocoLoop;核验参与人数、排序一致率、分配得分、各模型交易效率与预算委托比例。