No es una etiqueta de marketing. Es una función real.
En Code with Claude SF, el 6 de mayo, Anthropic anunció una nueva capacidad para Claude Managed Agents llamada Dreaming. Cuando un agente termina una tarea, puede usar los periodos de inactividad para revisar conversaciones anteriores, extraer patrones que no detectó en el momento y convertirlos en memoria de largo plazo. La próxima vez que aparezca una tarea similar, su comportamiento puede cambiar.
Dicho de forma sencilla, muchos agentes de IA anteriores acababan una tarea y empezaban la siguiente casi desde cero. Con Dreaming, el tiempo entre trabajos deja de desperdiciarse. El agente reflexiona, resume y actualiza su propio almacén de memoria.
La propia Anthropic lo explica con una analogía cercana a la de una persona que repasa el día después del trabajo.
Qué hace realmente Dreaming
Técnicamente, Dreaming es un proceso programado, no algo que el agente ejecute mientras está trabajando. Se activa cuando el agente está inactivo, recorre conversaciones pasadas y la memoria existente, y busca tres tipos principales de señales.
- Errores repetidos, por ejemplo un agente que falla cinco veces en una semana con la misma clase de consulta SQL. En una sola sesión puede no darse cuenta; al comparar varias, el patrón aparece.
- Flujos de trabajo que convergen, es decir, rutas que han llevado varias veces al éxito en tareas similares.
- Preferencias de equipo, como convenciones de nombres, estilo de código y formatos de informe compartidos por varios agentes.
Tras la extracción, el sistema de memoria no se limita a acumular contenido. Se reestructura. Anthropic lo resumió en su blog con esta frase: "Memory lets each agent capture what it learns as it works. Dreaming refines that memory between sessions."
Aprender mientras se trabaja y después digerir lo aprendido. Esa separación en dos capas es lo que distingue a Dreaming de un RAG tradicional o de una simple ventana de contexto más grande.
Los desarrolladores pueden controlar las actualizaciones de Dreaming de dos maneras. Pueden dejar que escriba nuevas memorias automáticamente, o exigir revisión humana antes de que cada hallazgo tenga efecto. La primera opción encaja con agentes desatendidos; la segunda, con flujos empresariales que necesitan auditoría.
Dreaming está actualmente en research preview.
Outcomes entrega también el criterio de aceptación a la IA
Junto con Dreaming, Anthropic presentó Outcomes, una función para otro problema: ayudar al agente a decidir si el trabajo está lo bastante bien hecho.
El mecanismo es claro. El desarrollador escribe una rubric, es decir, criterios que definen el éxito. El sistema ejecuta entonces un agente evaluador independiente, en su propio contexto. Si el resultado no alcanza el estándar, el evaluador señala problemas concretos y el agente original vuelve a intentarlo.
La clave es que el evaluador opera en un contexto separado. No es el agente corrigiéndose a sí mismo, algo que casi siempre tiende a aprobar. Un contexto limpio permite encontrar fallos sin el sesgo de reinterpretar el estándar en beneficio propio.
Según Anthropic, en pruebas internas Outcomes elevó la tasa de éxito de tareas hasta 10 puntos porcentuales frente a un prompt loop estándar, con mayores mejoras en tareas difíciles. En generación de archivos, la calidad de docx subió 8,4% y la de pptx, 10,1%.
Diez puntos en un benchmark no son poca cosa. Es una mejora parecida a la que muchos equipos esperan de una nueva generación de modelo. Aquí llegó por un mecanismo de colaboración, no por un modelo nuevo.
Outcomes está disponible como public beta.
Orquestación multiagente: de trabajador individual a equipo
La tercera novedad es Multi-agent Orchestration. No es tan rupturista como Dreaming, pero su valor práctico es evidente.
Permite que un lead agent reparta trabajo entre varios specialist agents. Cada specialist puede usar un modelo, un prompt y un conjunto de herramientas distintos. Todo el progreso queda trazable en Claude Console.
El ejemplo de Anthropic es una investigación de incidente. Un lead agent envía cuatro subagentes a revisar historial de deployment, error log, metrics y support ticket. Cuando terminan, el lead agent combina los resultados y entrega una conclusión.
La arquitectura sigue la misma lógica que el sistema interno de Code Review de Anthropic: varios reviewers trabajan en paralelo y un verifier separado hace la comprobación final. Ahora la compañía empaqueta ese patrón como producto para clientes.
Por qué el conjunto importa más que un anuncio de funciones
Vistas juntas, las tres piezas forman un bucle claro. Dreaming permite que los agentes mejoren entre tareas, Outcomes les permite evaluar el resultado y Multi-agent Orchestration les permite coordinarse con otros agentes.
Es un ciclo de autoaprendizaje: trabajar, ser evaluado, revisar, actualizar memoria y volver a trabajar. La intervención humana no tiene por qué estar presente en cada paso.
Por eso Code with Claude SF importó incluso sin un modelo nuevo. La ambición de Anthropic aquí va más allá de una actualización incremental como Opus 4.8.
Las mejoras de benchmark en modelos son cada vez más difíciles y costosas. Ganar entre 5% y 10% por generación exige más esfuerzo. Pero la capacidad laboral de los agentes no depende solo del modelo. También puede crecer mediante mecanismos de coordinación y experiencia acumulada. Si un aprendizaje de intervalo como Dreaming funciona de forma estable en producción, Anthropic tendrá una ruta de aceleración que no depende solo de forzar las scaling laws.
También hay riesgo. Un agente que escribe su propia memoria puede cristalizar conclusiones equivocadas. Anthropic ofrece revisión humana, pero habrá que ver durante meses de uso si los clientes empresariales aceptan actualizaciones de memoria totalmente automáticas.
¿Dreaming se convertirá en una función estándar de la próxima generación de agentes? Probablemente. Memory de OpenAI y Personal Context de Google ya avanzan hacia la memoria personalizada, pero Anthropic traslada la idea desde las preferencias del usuario a la capacidad de trabajo del agente. Si esa abstracción se sostiene, los competidores tendrán que responder.
Code with Claude SF también dejó otros datos: los 23.000 ingenieros de Mercado Libre tienen una meta de 90% de autonomía en código antes del tercer trimestre de 2026; el límite de cinco horas de Claude Code se duplicó; el volumen de llamadas API creció 17 veces interanual.
Pero la señal más importante no estuvo en esos números. Fue que los agentes empiezan a aprender a mejorar por sí mismos.
Fuentes: Anthropic is letting Claude agents 'dream' so they don't sleep on the job (SiliconANGLE); New in Claude Managed Agents: dreaming, outcomes, and multiagent orchestration (SD Times); CocoLoop; Live blog: Code w/ Claude 2026 (Simon Willison)