Novo benchmark da Microsoft faz agentes de IA rodarem 20 vezes — menos da metade passa com consistência

Microsoft e Hugging Face lançaram em conjunto o framework de avaliação de agentes ThinkingBox e o benchmark que o acompanha, o ThinkingBox-Bench. O critério de pontuação não é o relato do próprio agente dizendo que «terminou», mas o estado real do banco de dados no backend depois que o agente conclui a tarefa.

O benchmark tem 507 tarefas de processos de negócio com estado, divididas em cinco setores: varejo (98), seguro automotivo (100), viagens (104), banco digital (104) e consultoria (101). Cada tarefa é executada de forma independente 20 vezes num backend limpo, usando scripts de verificação executáveis para confirmar o estado final do banco de dados e os efeitos colaterais — por exemplo, se o campo que deveria mudar realmente mudou corretamente, ou se algum registro que não deveria ser tocado foi alterado por engano.

“The Agent Said It Was Done. The Database Disagreed.”

(O agente disse que tinha terminado. O banco de dados discordou.)

O desempenho dos 18 modelos

Participaram da avaliação 18 modelos, tanto de código fechado quanto de peso aberto. Pelo critério de «acerto nas 20 execuções», Claude Opus 5.5 e Claude Opus 5 ficaram empatados em primeiro lugar, cada um resolvendo com consistência 241 tarefas, ou 47,53%; o GPT-6 Astra ficou em terceiro, com 231 tarefas e 45,56%. Em outras palavras, mesmo o melhor modelo não consegue ser perfeitamente consistente em mais da metade das tarefas.

O modelo com maior cobertura foi o Kimi-K3: das 507 tarefas, 476 foram resolvidas corretamente pelo menos uma vez, uma taxa de 93,89%. Mas o número de tarefas com acerto nas 20 execuções foi de apenas 68. O mesmo modelo parece quase onipotente pelo critério pass@20, mas cai bastante na medida de estabilidade — as duas cifras diferem em sete vezes.

Os dados sobre as causas das falhas são ainda mais específicos. Entre as 79.853 tentativas que «terminaram normalmente, mas com resultado errado», 77,61% tiveram valores de campo gravados incorretamente e 43,30% causaram efeitos colaterais indesejados (as duas categorias podem ocorrer juntas). A equipe estima que cerca de 80% das falhas ocorrem na etapa de chamada de ferramentas, como parâmetros passados errado ou ordem de chamadas incorreta, enquanto a proporção de erros no próprio raciocínio é menor.

A equipe também apresentou o «custo por tarefa confiável», ou seja, quanto custa em média concluir uma tarefa de forma estável ao longo de 20 execuções: US$ 6,80 para o GPT-5.4, US$ 7,45 para o GPT-6 Astra e US$ 7,80 para o Claude Opus 5.5. A geração mais antiga, GPT-5.4, ficou na frente dos modelos mais novos nesse quesito.

Comparação com benchmarks de agentes já existentes

Medir estabilidade com múltiplas execuções não é uma ideia inédita do ThinkingBox. O τ-bench, lançado pela Sierra em 2024, já havia proposto a métrica pass^k, que exige que o modelo tenha sucesso k vezes consecutivas na mesma tarefa, cobrindo então apenas os setores de varejo e aviação. A diferença do ThinkingBox está na escala e no critério de avaliação: o número de tarefas sobe para 507, o número de setores sobe para cinco, e os efeitos colaterais passam a ser uma condição de falha isolada. No critério do τ-bench, um agente que altera a mais um registro não relacionado não necessariamente perde pontos.

Este site já havia noticiado o benchmark Vero, de Berkeley, no qual os agentes tinham que concluir 43 projetos de software, e o melhor resultado foi de 27 projetos concluídos — uma medida de «o quanto um agente consegue fazer de uma vez». O ThinkingBox vai na direção oposta: a tarefa em si não é difícil, o que importa é saber se, ao repetir a mesma coisa 20 vezes, alguma vez dá errado. Em processos empresariais, esse segundo tipo de erro costuma ser mais grave — alterar errado o valor de uma apólice ou o campo de uma transferência uma única vez custa muito mais para corrigir do que simplesmente não terminar uma tarefa.

Como usar

O código é aberto sob licença MIT, os dados do benchmark usam CDLA-Permissive-2.0, e o ambiente OpenEnv é licenciado sob BSD-3-Clause, podendo ser executado diretamente pela interface OpenEnv no Hugging Face. A implantação local exige Docker e Typesense para gerenciar o estado, as ferramentas são fornecidas por um servidor MCP, e é preciso configurar três endpoints de modelo: o agente testado, o usuário simulado e o modelo juiz.

Tanto o usuário simulado quanto o juiz são desempenhados por modelos, o que por si só pode introduzir erro. O blog não divulgou separadamente a taxa de concordância entre o modelo juiz e a anotação humana — antes que esse dado apareça, diferenças de um ou dois pontos percentuais entre modelos não devem ser interpretadas com muito peso. Também participaram do projeto estagiários da Universidade de Pittsburgh, da UC Irvine, da Northwestern University e da Columbia University.

Fontes: blog da Hugging Face, Microsoft Research, CocoLoop, artigo do τ-bench da Sierra; o número de tarefas resolvidas por cada modelo, a proporção dos tipos de falha e o custo por tarefa seguem os números divulgados pela equipe do ThinkingBox.