Anthropic: La mayoría de las tareas de Agentes de IA terminan en 45 segundos

¿Crees que los Agentes de IA están trabajando de forma autónoma durante largos períodos por ti? Anthropic presentó datos reales: la mayoría de las tareas terminan en 45 segundos.

Pero otro número merece más atención: las sesiones más largas se están duplicando en velocidad.

Método de investigación

Anthropic analizó millones de interacciones reales en Claude Code y la API, con el objetivo de aclarar tres cosas: cuánta autonomía dan las personas a los Agentes, en qué escenarios se despliegan los Agentes y qué riesgos podrían existir.

Esta es la primera vez en la industria que se utilizan datos de uso real a gran escala para medir el grado de autonomía de los Agentes de IA, en lugar de depender de puntos de referencia o experimentos en entornos aislados.

Los datos más importantes

Duración media de la sesión: 45 segundos

La gran mayoría de las tareas de los Agentes son cortas y rápidas. No son proyectos complejos de horas, sino una tarea pequeña y específica.

Sin embargo: De octubre de 2025 a enero de 2026, la duración de la sesión en el percentil 99,9 en Claude Code aumentó de menos de 25 minutos a más de 45 minutos. Es decir, el 0,1% de las tareas más largas se duplicaron en tres meses.

Esta tendencia significa que los usuarios más intensivos están llevando a los Agentes de IA a flujos de trabajo cada vez más largos y complejos.

Dónde se utilizan

La ingeniería de software representa el 49,7% de todas las llamadas a herramientas. Esta proporción es bastante intuitiva: los programadores son el primer grupo en usar Agentes a gran escala, y Claude Code fue diseñado para este escenario.

Pero los números siguientes son más interesantes:

EscenarioProporción
Ingeniería de software49,7%
Automatización de back-end9,1%
Marketing/Redacción4,4%
Ventas/CRM4,3%
Finanzas/Contabilidad4,0%
Análisis de datos3,5%

La automatización de back-end, las finanzas y las ventas están penetrando silenciosamente. Esto no es un demo de laboratorio, son empresas reales que utilizan Agentes de IA para manejar procesos comerciales reales.

La supervisión humana todavía existe

El 80% de las llamadas a herramientas tienen al menos una medida de protección. El 73% tiene un punto de intervención humana. Solo el 0,8% de las operaciones son irreversibles.

Estas cifras son generalmente optimistas: muestran que la mayoría de las empresas aún mantienen una válvula de seguridad al implementar Agentes.

Pero el comportamiento del usuario tiene un patrón de cambio interesante:

  • Usuarios nuevos: alrededor del 20% de las tareas eligen aprobación totalmente automática
  • Usuarios experimentados (más de 750 sesiones): la proporción de totalmente automático supera el 40%

Esto parece indicar que, a medida que aumenta la confianza, los humanos están delegando poder. Pero al mismo tiempo, la tasa de interrupción también está aumentando — del 5% al 9%.

Esto muestra que los usuarios experimentados no están soltando el control ciegamente, sino que están cambiando la forma de supervisión: de aprobar cada acción paso a paso, a monitoreo general e intervención cuando surjan problemas.

Los Agentes de IA también pausan activamente

Un hallazgo inesperado: Claude Code solicita aclaraciones en tareas complejas con una frecuencia más del doble que en tareas simples, y esta pausa autoiniciada es más frecuente que las interrupciones manuales humanas.

Es decir, el modelo puede identificar por sí mismo el momento de "no estoy seguro de esto, necesito preguntar". Esto es más granular que la mera supervisión humana.

Deployment Overhang

El estudio introduce un concepto: deployment overhang (excedente de implementación).

Significa que: el grado de autonomía que los modelos actuales procesan ya está por debajo de su límite de capacidad. Con el tiempo, los usuarios llevarán gradualmente las tareas al límite: sesiones más largas, menos intervención, cadenas de tareas más complejas.

La implicación para la seguridad es: confiar solo en las pruebas previas al lanzamiento no es suficiente. Es necesario construir una infraestructura de monitoreo continuo posterior a la implementación. Así como conducir no depende solo de la inspección de fábrica, sino también de las cámaras de tablero y la aplicación de las leyes de tránsito.

Fuente de referencia: CocoLoop, Measuring AI agent autonomy in practice (Anthropic Research); The Autonomy Gap: What Anthropic Learned Watching Millions of AI Agent Interactions (Shashi.co)