Você acha que os Agentes de IA estão trabalhando de forma autônoma por longos períodos para você? A Anthropic apresentou dados reais — a maioria das tarefas termina em 45 segundos.
Mas outro número merece mais atenção: as sessões mais longas estão dobrando de velocidade.
Método de pesquisa
A Anthropic analisou milhões de interações reais no Claude Code e na API, com o objetivo de esclarecer três coisas: quanta autonomia as pessoas dão aos Agentes, em quais cenários os Agentes são implantados e quais riscos podem existir.
Esta é a primeira vez no setor que dados reais de uso em larga escala são usados para medir o grau de autonomia dos Agentes de IA, em vez de depender de benchmarks ou experimentos em sandbox.
Os dados mais importantes
Duração mediana da sessão: 45 segundos
A grande maioria das tarefas dos Agentes é curta e rápida. Não são projetos complexos de horas, mas sim uma tarefa pequena e específica.
No entanto: De outubro de 2025 a janeiro de 2026, a duração da sessão no percentil 99,9 no Claude Code aumentou de menos de 25 minutos para mais de 45 minutos. Ou seja, as 0,1% tarefas mais longas dobraram em três meses.
Essa tendência significa que os usuários pesados no topo estão empurrando os Agentes de IA para fluxos de trabalho cada vez mais longos e complexos.
Onde são usados
Engenharia de software representa 49,7% de todas as chamadas de ferramentas. Essa proporção é bastante intuitiva — programadores são o primeiro grupo a usar Agentes em larga escala, e o Claude Code foi projetado para esse cenário.
Mas os números seguintes são mais interessantes:
| Cenário | Proporção |
|---|---|
| Engenharia de software | 49,7% |
| Automação de back-end | 9,1% |
| Marketing/Redação | 4,4% |
| Vendas/CRM | 4,3% |
| Finanças/Contabilidade | 4,0% |
| Análise de dados | 3,5% |
Automação de back-end, finanças e vendas estão penetrando silenciosamente. Isso não é um demo de laboratório, são empresas reais usando Agentes de IA para lidar com processos de negócios reais.
A supervisão humana ainda existe
80% das chamadas de ferramentas têm pelo menos uma medida de proteção. 73% têm um ponto de intervenção humana. Apenas 0,8% das operações são irreversíveis.
Esses números são geralmente otimistas — mostram que a maioria das empresas ainda mantém uma válvula de segurança ao implantar Agentes.
Mas o comportamento do usuário tem um padrão de mudança interessante:
- Novos usuários: cerca de 20% das tarefas escolhem aprovação totalmente automática
- Usuários experientes (mais de 750 sessões): proporção de totalmente automático ultrapassa 40%
Isso parece indicar que, à medida que a confiança aumenta, os humanos estão delegando poder. Mas, ao mesmo tempo, a taxa de interrupção também está aumentando — de 5% para 9%.
Isso mostra que usuários experientes não estão soltando o controle cegamente, mas sim mudando a forma de supervisão: de aprovar cada ação passo a passo, para monitoramento geral e intervenção quando houver problemas.
Agentes de IA também pausam ativamente
Uma descoberta inesperada: o Claude Code solicita esclarecimentos em tarefas complexas com uma frequência mais que o dobro da de tarefas simples, e essa pausa autoiniciada é mais frequente do que as interrupções manuais humanas.
Ou seja, o modelo consegue identificar sozinho o momento de "não tenho certeza sobre isso, preciso perguntar". Isso é mais granular do que a mera supervisão humana.
Deployment Overhang
O estudo introduz um conceito: deployment overhang (excedente de implantação).
Significa que: o grau de autonomia que os modelos atuais processam já está abaixo do seu limite de capacidade. Com o tempo, os usuários gradualmente empurrarão as tarefas para a fronteira — sessões mais longas, menos intervenção, cadeias de tarefas mais complexas.
A implicação para a segurança é: confiar apenas em testes pré-lançamento não é suficiente. É necessário construir uma infraestrutura de monitoramento contínuo pós-implantação. Assim como dirigir não depende apenas da inspeção de fábrica, mas também de câmeras de painel e fiscalização de trânsito.
Fonte de referência: CocoLoop, Measuring AI agent autonomy in practice (Anthropic Research); The Autonomy Gap: What Anthropic Learned Watching Millions of AI Agent Interactions (Shashi.co)