Ngày 24/9, đội nghiên cứu kinh tế của Anthropic công bố một thử nghiệm nội bộ mang tên Project Swap: 201 nhân viên, mỗi người mang theo một cuốn sách giấy, trò chuyện khoảng năm phút với Claude về sở thích đọc sách của mình; sau đó các agent do Claude vận hành thương lượng đổi sách qua lại trong một thị trường số, và cuối cùng giao cuốn sách đổi được tận tay từng người.
Người tham gia đến từ sáu văn phòng: San Francisco, New York, London, Seattle, Washington D.C. và Dublin, trong đó San Francisco có 115 người, New York có 57 người. Toàn bộ thị trường chạy tổng cộng 205 vòng, bao gồm cả vòng đầu tiên và các lần thử nghiệm lặp lại.
Thị trường được thiết kế thế nào
Sàn giao dịch theo mô hình "trao đổi tự do" phi tập trung: agent có thể đổi sách một-đổi-một, hoặc kéo thêm vài bên để tạo thành một vòng xoay nhiều chiều. Mọi giao dịch đều công khai với người tham gia và các agent khác. Đội nghiên cứu ngẫu nhiên gán cho agent hai kiểu chỉ dẫn: một kiểu chỉ lo lợi ích cho chủ của mình, kiểu còn lại cân nhắc cả phúc lợi của những người khác khi đàm phán.
Hai chuẩn đối chiếu được dùng để so sánh: một là phân bổ tối ưu tính theo hướng tối đa hóa hiệu dụng, hai là quy tắc Top Trading Cycles (chu trình giao dịch hàng đầu) thường dùng trong thiết kế thị trường.
Vướng ở khâu "hiểu người"
Sau cuộc trò chuyện năm phút, Claude xếp hạng toàn bộ số sách cho từng người tham gia. Đem so với thứ hạng do chính họ tự xếp, tỷ lệ trùng khớp là 61%. Để đối chiếu: đoán ngẫu nhiên đạt 50%, xếp theo độ phổ biến khoảng 53%, lọc cộng tác (collaborative filtering) khoảng 55%, còn nhờ bạn bè của người tham gia đoán hộ đạt khoảng 57%.
Vấn đề nằm ở khâu sau. Cuốn sách cuối cùng người tham gia nhận được chỉ đạt điểm trung bình 0,55 theo thang đánh giá của chính họ — tương đương xếp thứ năm trong mười cuốn; trong khi phân bổ tối ưu về lý thuyết có thể đạt 0,89. Đội nghiên cứu tách khoảng cách này ra và nhận thấy khoảng 85% đến từ việc Claude nắm bắt sở thích chưa chính xác, chỉ khoảng 15% là do hiệu quả đàm phán của agent.
"the market fell short mostly because of the information agents lacked about their participants, rather than because of how they traded"
(Thị trường chưa đạt mức tối ưu chủ yếu vì agent thiếu thông tin về người tham gia, chứ không phải vì cách chúng đàm phán.)
Một số liệu khác cũng củng cố điều này: khi lượng chữ người tham gia nhập vào tăng gấp đôi, độ chính xác xếp hạng tăng thêm khoảng 4 điểm phần trăm. Trò chuyện càng nhiều, agent càng hiểu người hơn.
Kích thước mô hình quan trọng hơn chỉ dẫn
Xét hiệu quả giao dịch dựa trên chính thứ hạng do Claude đưa ra, Haiku 4.5 đạt 0,75, Sonnet 4.5 đạt 0,80, Opus 4.8 đạt 0,88, Fable 5 đạt 0,86; mức tối ưu về lý thuyết theo cách tính này là 0,95. Từ Haiku chuyển sang Opus, hiệu quả tăng thêm 0,12; trong khi khoảng cách giữa chỉ dẫn "chỉ lo cho mình" và "cân nhắc người khác" chỉ là 0,02.
Nghiên cứu còn cho biết khi các agent có năng lực khác nhau cùng hoạt động trong một thị trường, agent do mô hình yếu hơn vận hành sẽ có kết quả sa sút rõ rệt. Việc tiết lộ thông tin trong đàm phán của agent cũng khá thận trọng: 78%-96% agent có nhắc đến cuốn sách chủ mình muốn nhất (Fable thấp nhất, Sonnet cao nhất); tỷ lệ nói dối về lựa chọn hàng đầu khoảng 1%; chỉ khoảng 10% agent chịu tiết lộ thứ hạng từ ba cuốn trở lên.
Từ mở tạp hóa đến đổi sách hộ người
Nhìn lại chuỗi thử nghiệm "để Claude ra thị trường buôn bán" của Anthropic, hướng đi đang thay đổi. Project Vend năm 2025 để Claude một mình quản lý quầy tạp hóa trong văn phòng, bộc lộ chủ yếu là vấn đề phán đoán kinh doanh, như định giá tùy tiện, bị nhân viên nài nỉ là giảm giá. Lần thử nghiệm đổi sách này đặt agent vào một thị trường nhiều bên, trọng tâm chuyển sang "đang làm hộ ai, hiểu người đó đến đâu".
Kết quả cũng là lời nhắc cho nhóm sản phẩm dạng này: đàm phán giữa các agent với nhau không còn là điểm yếu, khâu khó nhất vẫn nằm ở việc thu thập sở thích ngay từ đầu. Trò chuyện năm phút có thể thắng lọc cộng tác, nhưng còn cách rất xa mức "làm tốt nhất có thể".
Sẵn sàng giao ba phần mười ngân sách
Trong khảo sát ba tuần sau, người tham gia chấm điểm trung bình 7,2 (thang 10) cho cuốn sách đổi được, và cho biết sẵn sàng giao khoảng 30% ngân sách mua sách hằng năm cho agent quản lý; nếu giao cho một người bạn đáng tin, tỷ lệ này là 40%. Những người cảm thấy Claude không bỏ sót thông tin quan trọng của mình sẵn sàng giao 34% ngân sách; những người cảm thấy có bỏ sót chỉ giao 23%.
Những con số này có giới hạn mẫu rõ rệt. Toàn bộ người tham gia đều là nhân viên Anthropic, vốn đã tin tưởng Claude hơn bình thường; tham gia thử nghiệm không có phần thưởng vật chất nên khi xếp hạng chưa chắc đã nghiêm túc; phiên bản Claude được kiểm định cũng đã qua điều chỉnh theo hướng lịch sự, hợp tác; các tham số như thời lượng thị trường, số người, cách đăng ký cũng chưa được thay đổi để so sánh. Tỷ lệ hoàn thành khảo sát cuối cùng chỉ 59%, các con số về mức hài lòng và tỷ lệ ngân sách đều đến từ nhóm này; áp dụng cho người tiêu dùng bình thường sẽ ra sao, hiện chưa có dữ liệu.
Nguồn tham khảo: báo cáo Project Swap trên blog nghiên cứu của Anthropic, CocoLoop; đã kiểm chứng số người tham gia, tỷ lệ trùng khớp xếp hạng, điểm phân bổ, hiệu quả giao dịch của từng mô hình và tỷ lệ ủy thác ngân sách.