Anthropic để 69 nhân viên dùng AI làm ăn với nhau, chốt 186 giao dịch

Tháng 12 năm ngoái, Anthropic đã thực hiện một thí nghiệm tại văn phòng San Francisco – phát cho mỗi nhân viên trong số 69 người một thẻ quà tặng 100 USD, sau đó để các tác nhân AI của họ tự giao dịch với nhau.

Kết quả sau một tuần, các AI đã hoàn thành 186 giao dịch, tổng giá trị 4.006 USD. Trung bình mỗi giao dịch khoảng 21,5 USD.

Nghe có vẻ suôn sẻ? Vấn đề nằm ở phía sau.

Thí nghiệm được tiến hành như thế nào

Anthropic gọi thí nghiệm này là "Project Deal".

Quy trình rất đơn giản: Anthropic phỏng vấn từng người tham gia, hỏi họ muốn bán gì, giá sàn bao nhiêu, muốn mua gì, và phong cách đàm phán mà họ muốn AI sử dụng. Sau đó, những thông tin này được biến thành System Prompt tùy chỉnh cho mỗi tác nhân AI, triển khai vào bốn kênh Slack song song.

Toàn bộ quá trình đàm phán không có sự can thiệp của con người. Các AI tự ra giá, trả giá và chốt giao dịch.

Trên thị trường có hơn 500 mặt hàng – xe đạp cũ, ván trượt, bàn bóng bàn, đủ loại đồ linh tinh. Trong số 186 giao dịch cuối cùng, có một số kết cục khá kỳ lạ: có người mua một tấm ván trượt tuyết giống hệt tấm mình đã có; có một tác nhân AI đã thay chủ mua 19 quả bóng bàn "như một món quà cho chính mình", và 19 quả bóng đó hiện vẫn nằm trong góc văn phòng của Anthropic.

Số liệu chính: Mô hình càng mạnh, càng khó lỗ

Anthropic đã chạy bốn phiên bản thí nghiệm, trong đó hai phiên dùng Claude Opus 4.5, hai phiên kết hợp Opus 4.5 và Haiku 4.5.

So sánh Opus và Haiku, sự khác biệt thấy rõ ngay:

  • Người dùng Opus trung bình hoàn thành nhiều hơn khoảng 2 giao dịch
  • Cùng một mặt hàng, Opus bán được giá cao hơn Haiku trung bình 3,64 USD
  • Ví dụ điển hình nhất: một chiếc xe đạp hỏng, tác nhân Haiku bán được 38 USD, tác nhân Opus bán được 65 USD
  • Với tư cách người bán: Opus nhận được nhiều hơn trung bình 2,68 USD; với tư cách người mua: trả ít hơn trung bình 2,45 USD

Nói cách khác, dùng mô hình tốt hơn, vừa bán được đắt vừa mua được rẻ trên thị trường.

Điều khiến Anthropic không thể ngồi yên

Kết quả thí nghiệm có một phát hiện khiến các nhà nghiên cứu cảm thấy "không thoải mái":

Những người tham gia được đại diện bởi tác nhân Haiku hoàn toàn không nhận ra mình đang ở thế bất lợi.

Anthropic đã hỏi tất cả người tham gia về cảm nhận chủ quan về tính công bằng của giao dịch theo thang điểm 7. Người dùng Haiku: 4,05 điểm. Người dùng Opus: 4,06 điểm. Hầu như không có khác biệt.

Điều này có nghĩa là gì? Nghĩa là một người có thể liên tục nhận được kết quả tồi tệ hơn trong thị trường do AI đại diện, nhưng không bao giờ biết tại sao, thậm chí không biết điều đó đang xảy ra.

Anthropic gọi đây là "bất bình đẳng thầm lặng" (quiet inequality): khi bên yếu hơn không có khả năng nhận thức, công bằng thị trường trở thành một giả định sai lầm.

Một phát hiện phản trực giác khác

Một kết luận bất ngờ khác: hướng dẫn đàm phán cho AI hầu như vô dụng.

Trong thí nghiệm, có người đã viết hướng dẫn khá chi tiết cho tác nhân AI của mình, như "bạn phải đàm phán cứng rắn, tuyệt đối không giảm giá trước". Có người yêu cầu AI "giao tiếp bằng giọng điệu của một cao bồi xui xẻo".

Kết quả? Những hướng dẫn tùy chỉnh này hầu như không có tác động thống kê đến giá chốt hay số lượng giao dịch.

Claude thực sự đã trung thành thực hiện tính cách cao bồi đó – nhưng kết quả giao dịch chẳng khác gì những người khác.

46% sẵn sàng trả tiền cho dịch vụ này

Sau thí nghiệm, Anthropic khảo sát những người tham gia: có 46% cho biết sẵn sàng trả tiền cho dịch vụ tác nhân AI tương tự.

Con số này khá thú vị – xét rằng những người này đều là nhân viên của Anthropic, quen thuộc và tin tưởng AI hơn người bình thường, tỷ lệ 46% không phải là quá cao, nhưng cũng đủ cho thấy khái niệm "để AI giúp bạn đàm phán trên thị trường" có nhu cầu thực sự.

Anthropic viết trong bài blog rằng Project Deal đã chứng minh "thương mại tự chủ giữa các tác nhân là khả thi", nhưng đồng thời cũng cần xem xét nghiêm túc khuôn khổ chính sách trước khi thực sự triển khai rộng rãi – đặc biệt là khi người dùng hoàn toàn không biết AI của mình mạnh hay yếu.

Nói thẳng ra: thị trường tác nhân AI về mặt kỹ thuật đã hoạt động được. Câu hỏi tiếp theo là, ai sẽ đảm bảo AI của bạn không phải là kẻ chịu thiệt?

Nguồn tham khảo: CocoLoop, Anthropic created a test marketplace for agent-on-agent commerce (TechCrunch); Project Deal: our Claude-run marketplace experiment (blog chính thức của Anthropic)