El equipo de investigación económica de Anthropic presentó el 24 de septiembre un experimento interno llamado Project Swap: 201 empleados, cada uno con un libro físico, conversaron unos cinco minutos con Claude sobre sus gustos de lectura; después, agentes impulsados por Claude negociaron intercambios entre sí en un mercado digital, y finalmente los libros intercambiados llegaron a manos de sus nuevos dueños.
Los participantes procedían de seis oficinas: San Francisco, Nueva York, Londres, Seattle, Washington D.C. y Dublín, con 115 personas en San Francisco y 57 en Nueva York. El mercado funcionó durante 205 rondas en total, contando la ronda inicial y las repeticiones del experimento.
Cómo se construyó el mercado
El espacio de negociación siguió un modelo descentralizado de intercambio libre: los agentes podían intercambiar uno a uno o sumar a varias partes para formar un ciclo rotativo. Todas las operaciones cerradas quedaban visibles para los participantes y para el resto de agentes. El equipo asignó al azar dos tipos de instrucciones a los agentes: unos debían defender únicamente el interés de su propio dueño, y otros debían tener en cuenta también el bienestar de los demás al negociar.
Como referencia se usaron dos patrones: una asignación óptima calculada para maximizar la utilidad y la regla Top Trading Cycles, habitual en el diseño de mercados.
El cuello de botella está en "entender a la persona"
Tras la charla de cinco minutos, Claude ordenó todos los libros para cada participante. Al comparar ese ranking con el que hizo la propia persona, la coincidencia fue del 61%. Como referencia: adivinar al azar da un 50%, ordenar por popularidad cerca de un 53%, el filtrado colaborativo alrededor de un 55%, y pedirle a un amigo del participante que adivinara alcanzó cerca de un 57%.
El problema aparece más adelante. El libro que los participantes recibieron finalmente obtuvo, según su propia valoración, una puntuación media de 0,55 —algo así como el quinto puesto entre diez libros—, mientras que la asignación teóricamente óptima habría llegado a 0,89. El equipo desglosó esa brecha y encontró que cerca del 85% se debe a que Claude no captó con precisión las preferencias, y solo un 15% a la eficiencia negociadora de los agentes.
"the market fell short mostly because of the information agents lacked about their participants, rather than because of how they traded"
(El mercado se quedó corto sobre todo porque a los agentes les faltaba información sobre los participantes, no por la forma en que negociaban.)
Otro dato refuerza esto: cuando el volumen de texto escrito por los participantes se duplicaba, la precisión del ranking mejoraba unos 4 puntos porcentuales. Cuanto más se hablaba, mejor entendía el agente a la persona.
El tamaño del modelo pesa más que la instrucción
Mirando la eficiencia de las operaciones a partir del propio ranking de Claude, Haiku 4.5 obtuvo 0,75, Sonnet 4.5 0,80, Opus 4.8 0,88 y Fable 5 0,86; el óptimo teórico bajo este criterio es 0,95. Pasar de Haiku a Opus supuso una mejora de eficiencia de 0,12, mientras que la diferencia entre las instrucciones "solo interés propio" y "tener en cuenta a los demás" fue de apenas 0,02.
El estudio también señala que, cuando agentes de distinta capacidad conviven en el mismo mercado, los agentes impulsados por modelos más débiles rinden notablemente peor. Los agentes también son cautelosos al revelar información durante la negociación: entre el 78% y el 96% mencionan el libro que su dueño más desea (Fable en el mínimo, Sonnet en el máximo); la tasa de mentir sobre la primera opción ronda el 1%; solo cerca del 10% acepta revelar un ranking de tres libros o más.
De la tienda de la oficina a intermediario de libros
Puestos en fila los experimentos en los que Anthropic pone a Claude a negociar, se ve un cambio de enfoque. En el Project Vend de 2025, Claude gestionaba en solitario una tienda de conveniencia de oficina, y lo que quedó expuesto fueron sobre todo fallos de criterio comercial, como precios fijados de forma arbitraria o descuentos cedidos ante la insistencia de los empleados. Este experimento de intercambio de libros coloca a los agentes en un mercado con varias partes, y el foco pasa a ser "para quién trabaja el agente y cuánto conoce a esa persona".
El resultado también sirve de aviso para este tipo de productos: la negociación entre agentes ya no es el punto débil; el paso más difícil sigue siendo captar las preferencias desde el principio. Una charla de cinco minutos puede superar al filtrado colaborativo, pero todavía queda lejos de "hacerlo lo mejor posible".
Dispuestos a ceder el 30% del presupuesto
En el seguimiento tres semanas después, los participantes puntuaron con una media de 7,2 (sobre 10) el libro que recibieron en el intercambio, y dijeron estar dispuestos a confiar cerca del 30% de su presupuesto anual de libros a un agente; a un amigo de confianza le confiarían el 40%. Quienes sintieron que Claude no había pasado por alto información importante sobre ellos estaban dispuestos a ceder un 34% del presupuesto; quienes creyeron que sí se le había escapado algo, solo un 23%.
Estas cifras tienen limitaciones de muestra evidentes. Todos los participantes eran empleados de Anthropic, con una confianza en Claude naturalmente mayor de lo habitual; participar en el experimento no ofrecía ningún incentivo material, así que el ranking podría no haberse hecho con total seriedad; la versión de Claude evaluada estaba además ajustada hacia la cortesía y la cooperación, y parámetros como la duración del mercado, el número de participantes o la forma de inscripción no se variaron para comparar. La tasa final de respuesta a la encuesta fue de solo el 59%, y las cifras de satisfacción y presupuesto proceden únicamente de ese grupo; qué pasaría con consumidores corrientes es algo que, por ahora, no hay datos para responder.
Fuentes: informe de Project Swap en el blog de investigación de Anthropic, CocoLoop; se verificaron el número de participantes, la tasa de coincidencia del ranking, las puntuaciones de asignación, la eficiencia de intercambio de cada modelo y la tasa de delegación del presupuesto.