Anthropic Uji Claude Jadi Makelar Tukar Buku 201 Karyawan

Tim riset ekonomi Anthropic mengumumkan hasil eksperimen internal bernama Project Swap pada 24 September. Sebanyak 201 karyawan masing-masing membawa satu buku fisik, lalu lebih dulu mengobrol dengan Claude selama sekitar lima menit untuk menceritakan buku seperti apa yang mereka sukai. Setelah itu, agen yang digerakkan Claude saling bernegosiasi menukar buku di sebuah pasar digital, dan buku hasil pertukaran itu diserahkan kembali ke pemiliknya.

Peserta berasal dari enam kantor — San Francisco, New York, London, Seattle, Washington D.C., dan Dublin — dengan 115 orang dari San Francisco dan 57 orang dari New York. Pasar ini berjalan total 205 putaran, termasuk putaran pertama dan uji ulang.

Bagaimana Pasar Ini Dirancang

Mekanisme perdagangannya bersifat desentralisasi dengan model “perdagangan bebas”: agen bisa bertukar satu lawan satu, atau menggabungkan beberapa pihak menjadi siklus bergilir. Setiap transaksi yang berhasil bisa dilihat oleh peserta dan agen lain. Tim riset secara acak memberi agen salah satu dari dua instruksi: murni memperjuangkan kepentingan pemiliknya sendiri, atau ikut mempertimbangkan kesejahteraan pihak lain saat bernegosiasi.

Ada dua tolok ukur pembanding: alokasi optimal berdasarkan maksimalisasi utilitas, dan aturan Top Trading Cycles yang lazim dipakai dalam desain pasar.

Terganjal di Tahap “Memahami Orang”

Setelah obrolan lima menit, Claude menyusun urutan seluruh buku untuk tiap peserta. Saat dibandingkan satu per satu dengan urutan pilihan asli masing-masing orang, tingkat kecocokannya 61%. Sebagai pembanding, tebakan acak menghasilkan 50%, pengurutan berdasar popularitas sekitar 53%, collaborative filtering sekitar 55%, dan tebakan dari teman peserta sekitar 57%.

Masalahnya muncul di tahap berikutnya. Buku yang akhirnya diterima peserta, jika dinilai menurut standar mereka sendiri, rata-rata hanya mendapat skor 0,55 — kira-kira setara peringkat kelima dari sepuluh buku — sementara alokasi optimal teoretis bisa mencapai 0,89. Setelah diurai, tim riset menemukan sekitar 85% dari selisih ini berasal dari Claude yang kurang akurat menangkap preferensi, dan hanya sekitar 15% yang disebabkan oleh efisiensi negosiasi antar-agen.

the market fell short mostly because of the information agents lacked about their participants, rather than because of how they traded

(Artinya, pasar ini gagal mencapai hasil optimal terutama karena kurangnya informasi yang dimiliki agen tentang peserta, bukan karena cara mereka bernegosiasi.)

Data lain juga mendukung temuan ini: ketika jumlah teks yang diketik peserta berlipat dua, akurasi pengurutan naik sekitar 4 poin persentase. Semakin banyak mengobrol, semakin agen memahami orangnya.

Ukuran Model Lebih Menentukan daripada Instruksi

Diukur dari urutan buatan Claude sendiri, efisiensi transaksi Haiku 4.5 mencapai 0,75, Sonnet 4.5 sebesar 0,80, Opus 4.8 sebesar 0,88, dan Fable 5 sebesar 0,86, dengan nilai optimal teoretis pada ukuran ini 0,95. Berpindah dari Haiku ke Opus menaikkan efisiensi sebesar 0,12, sementara selisih antara instruksi “mementingkan diri sendiri” dan “mempertimbangkan orang lain” hanya 0,02.

Riset ini juga menemukan bahwa ketika agen dengan kemampuan berbeda berada di pasar yang sama, performa agen yang digerakkan model lebih lemah menurun cukup jelas. Agen juga cukup berhati-hati dalam membuka informasi selama negosiasi: 78% hingga 96% agen menyebutkan buku yang paling diinginkan pemiliknya — Fable paling rendah, Sonnet paling tinggi; sekitar 1% berbohong soal pilihan utama; dan hanya 10% yang mau mengungkap urutan tiga buku atau lebih.

Dari Jualan di Toko Kecil ke Makelar Tukar Buku

Jika dirangkai, rangkaian eksperimen Anthropic yang menerjunkan Claude ke dunia dagang ini menunjukkan pergeseran fokus. Project Vend pada 2025 membiarkan Claude mengelola toko kecil kantor sendirian, dan yang terungkap kebanyakan adalah masalah penilaian bisnis, seperti penetapan harga yang serampangan atau memberi diskon begitu didesak karyawan. Eksperimen tukar buku ini menempatkan agen di pasar multi-pihak, dan fokus pengujiannya bergeser menjadi soal mewakili siapa, dan seberapa paham agen itu terhadap orangnya.

Hasilnya juga jadi peringatan bagi produk sejenis: negosiasi antar-agen kini bukan lagi titik lemahnya, bagian tersulit tetap ada di pengumpulan preferensi di tahap awal. Obrolan lima menit bisa mengalahkan collaborative filtering, tapi masih jauh dari hasil yang benar-benar optimal.

Bersedia Menyerahkan 30% Anggaran

Dalam survei lanjutan tiga minggu kemudian, peserta memberi skor rata-rata 7,2 (dari 10) untuk buku yang mereka terima, dan menyatakan bersedia menyerahkan sekitar 30% anggaran tahunan pembelian buku mereka kepada agen untuk dikelola — dibanding 40% jika diserahkan ke teman yang dipercaya. Peserta yang merasa Claude tidak melewatkan informasi penting tentang dirinya bersedia menyerahkan 34% anggaran, sementara yang merasa ada yang terlewat hanya bersedia menyerahkan 23%.

Angka-angka ini punya keterbatasan sampel yang jelas. Semua peserta adalah karyawan Anthropic, yang secara alami lebih mempercayai Claude; tidak ada insentif materiil untuk ikut eksperimen ini, sehingga peserta belum tentu serius saat menyusun urutan; yang diuji juga hanya versi Claude yang sudah disetel ke arah sopan dan kooperatif; parameter seperti lama pasar berjalan, jumlah peserta, dan cara pendaftaran juga tidak pernah diubah. Tingkat penyelesaian survei akhir hanya 59%, dan angka kepuasan maupun proporsi anggaran yang didelegasikan semuanya berasal dari kelompok ini saja — belum ada data soal bagaimana hasilnya jika diterapkan pada konsumen biasa.

Sumber: laporan Project Swap dari blog riset Anthropic, CocoLoop; diverifikasi terhadap jumlah peserta, tingkat kecocokan urutan, skor alokasi, efisiensi transaksi per model, dan persentase pendelegasian anggaran.