A equipe de pesquisa econômica da Anthropic anunciou em 24 de setembro um experimento interno chamado Project Swap: 201 funcionários, cada um trazendo um livro físico, conversaram por cerca de cinco minutos com o Claude sobre suas preferências de leitura; em seguida, agentes conduzidos pelo Claude negociaram trocas entre si em um mercado digital, e os livros trocados foram finalmente entregues aos respectivos donos.
Os participantes estavam distribuídos em seis escritórios — São Francisco, Nova York, Londres, Seattle, Washington D.C. e Dublin —, sendo 115 em São Francisco e 57 em Nova York. O mercado rodou ao todo 205 rodadas, incluindo a rodada inicial e repetições do experimento.
Como o mercado foi montado
O ambiente de negociação seguiu um modelo descentralizado de troca livre: os agentes podiam trocar um a um ou reunir várias partes em um ciclo rotativo. Todos os negócios fechados ficavam visíveis para os participantes e para os demais agentes. A equipe atribuiu aleatoriamente dois tipos de instrução aos agentes: um voltado apenas a defender o interesse do seu próprio dono, outro que também levava em conta o bem-estar dos demais durante a negociação.
Dois padrões serviram de comparação: uma alocação ótima calculada para maximizar a utilidade e a regra Top Trading Cycles, comum no desenho de mercados.
O gargalo está em "entender a pessoa"
Depois da conversa de cinco minutos, o Claude classificou todos os livros para cada participante. Comparando esse ranking com o que a própria pessoa fez, a taxa de coincidência foi de 61%. Como referência: um palpite aleatório dá 50%, ordenar por popularidade cerca de 53%, filtragem colaborativa cerca de 55%, e pedir para um amigo do participante adivinhar chegou a cerca de 57%.
O problema aparece mais adiante. O livro que os participantes de fato receberam teve, na avaliação deles mesmos, nota média de 0,55 — algo como o quinto lugar entre dez livros —, enquanto a alocação teoricamente ótima chegaria a 0,89. A equipe decompôs essa diferença e constatou que cerca de 85% vêm do Claude não captar bem as preferências, e apenas 15% da eficiência de negociação dos agentes.
"the market fell short mostly because of the information agents lacked about their participants, rather than because of how they traded"
(O mercado ficou aquém principalmente porque os agentes careciam de informações sobre os participantes, e não por causa de como negociavam.)
Outro dado reforça isso: quando o volume de texto digitado pelos participantes dobrava, a precisão do ranking subia cerca de 4 pontos percentuais. Quanto mais conversa, mais o agente entendia a pessoa.
Tamanho do modelo pesa mais que a instrução
Olhando a eficiência das trocas com base no próprio ranking feito pelo Claude, o Haiku 4.5 ficou em 0,75, o Sonnet 4.5 em 0,80, o Opus 4.8 em 0,88 e o Fable 5 em 0,86; o ótimo teórico nesse critério é 0,95. Passar do Haiku para o Opus rendeu um ganho de eficiência de 0,12, enquanto a diferença entre as instruções "só interesse próprio" e "considerar os outros" foi de apenas 0,02.
O estudo também aponta que, quando agentes de capacidades diferentes atuam no mesmo mercado, os agentes movidos por modelos mais fracos têm desempenho visivelmente pior. Na negociação, os agentes também são cautelosos ao revelar informações: entre 78% e 96% mencionam o livro que o dono mais quer (Fable no piso, Sonnet no topo); a taxa de mentira sobre a primeira escolha fica em torno de 1%; só cerca de 10% se dispõem a revelar um ranking de três livros ou mais.
De loja de conveniência a corretor de livros
Colocando lado a lado os experimentos em que a Anthropic coloca o Claude para negociar, dá para ver uma mudança de foco. O Project Vend, de 2025, deixou o Claude sozinho administrando uma loja de conveniência no escritório, e expôs principalmente falhas de julgamento comercial, como preços definidos de forma arbitrária e descontos concedidos sob insistência dos funcionários. Este experimento de troca de livros coloca os agentes num mercado com várias partes, e o foco passa a ser "para quem o agente está trabalhando e quanto ele conhece essa pessoa".
O resultado também serve de alerta para esse tipo de produto: a negociação entre agentes já não é o ponto fraco — a etapa mais difícil continua sendo captar as preferências logo no início. Uma conversa de cinco minutos consegue superar a filtragem colaborativa, mas ainda está longe de "fazer o melhor possível".
Disposição para ceder 30% do orçamento
Na pesquisa de acompanhamento três semanas depois, os participantes deram nota média de 7,2 (de 10) ao livro que receberam na troca, e disseram estar dispostos a confiar cerca de 30% do orçamento anual de livros a um agente; para um amigo de confiança, essa proporção sobe a 40%. Quem sentiu que o Claude não deixou passar informações importantes sobre si mesmo topou ceder 34% do orçamento; quem achou que algo ficou de fora, apenas 23%.
Esses números têm limitações claras de amostra. Todos os participantes eram funcionários da Anthropic, naturalmente mais propensos a confiar no Claude; participar do experimento não trazia recompensa material, então o ranking pode não ter sido feito com todo o cuidado; a versão de Claude testada também já era ajustada para ser educada e cooperativa; parâmetros como duração do mercado, número de participantes e forma de inscrição não foram alterados para comparação. A taxa final de resposta à pesquisa foi de apenas 59%, e os números de satisfação e orçamento vêm só desse grupo — como isso se comportaria com consumidores comuns ainda não se sabe.
Fontes: relatório do Project Swap no blog de pesquisa da Anthropic, CocoLoop; verificados o número de participantes, a taxa de coincidência do ranking, as notas de alocação, a eficiência de troca de cada modelo e a taxa de delegação do orçamento.