Đây không phải khẩu hiệu tiếp thị, mà là một chức năng thật.
Tại Code with Claude SF ngày 6/5, Anthropic công bố một năng lực mới cho Claude Managed Agents mang tên Dreaming. Sau khi hoàn tất công việc, agent có thể dùng thời gian nhàn rỗi để xem lại các cuộc hội thoại trước đó, rút ra những mẫu hành vi mà nó chưa nhận ra lúc đang làm, rồi biến chúng thành trí nhớ dài hạn. Khi gặp nhiệm vụ tương tự lần sau, cách hành động của nó có thể thay đổi.
Nói đơn giản, nhiều agent AI trước đây kết thúc một nhiệm vụ rồi gần như bắt đầu lại từ đầu ở nhiệm vụ kế tiếp. Dreaming khiến khoảng nghỉ giữa các phiên làm việc không còn bị bỏ phí: agent tự phản tư, tự tóm lược và cập nhật kho nhớ của chính mình.
Anthropic cũng dùng hình ảnh gần với việc con người nằm lại sau giờ làm để nhìn lại cả ngày.
Dreaming thực sự làm gì
Về kỹ thuật, Dreaming là một tiến trình chạy theo lịch, không phải việc agent tranh thủ làm trong lúc đang xử lý nhiệm vụ. Nó được kích hoạt khi agent rảnh, đi qua các hội thoại cũ và kho nhớ hiện có để tìm ba loại tín hiệu.
- Lỗi lặp lại, chẳng hạn một agent vấp cùng một kiểu truy vấn SQL năm lần trong một tuần. Trong từng phiên riêng lẻ, nó có thể không thấy vấn đề; nhìn xuyên phiên thì mẫu lỗi hiện ra rõ hơn.
- Quy trình đã hội tụ, tức những lộ trình nhiều lần giúp hoàn thành thành công các nhiệm vụ cùng loại.
- Sở thích ở cấp đội nhóm, gồm quy ước đặt tên, phong cách code và định dạng báo cáo được nhiều agent cùng tuân theo.
Sau khi trích xuất, hệ thống trí nhớ không chỉ chất thêm dữ liệu mà được tái cấu trúc. Anthropic viết trong blog: "Memory lets each agent capture what it learns as it works. Dreaming refines that memory between sessions."
Học trong lúc làm, rồi tiêu hóa lại sau khi làm xong. Cấu trúc hai lớp này là điểm khác biệt cốt lõi so với RAG truyền thống hay việc chỉ mở rộng context window.
Nhà phát triển có hai cách kiểm soát cập nhật của Dreaming. Họ có thể để hệ thống tự động ghi trí nhớ mới, hoặc yêu cầu con người review từng phát hiện trước khi có hiệu lực. Cách đầu hợp với agent vận hành không giám sát; cách sau phù hợp hơn với quy trình doanh nghiệp cần kiểm toán.
Dreaming hiện ở giai đoạn research preview.
Outcomes đưa tiêu chuẩn nghiệm thu cho AI
Cùng với Dreaming, Anthropic còn công bố Outcomes, một tính năng xử lý vấn đề khác: giúp agent tự biết kết quả làm ra đã đạt chuẩn hay chưa.
Cách dùng khá rõ. Nhà phát triển viết một rubric, tức bộ tiêu chí mô tả thế nào là thành công. Hệ thống sau đó chạy một grader agent riêng trong ngữ cảnh độc lập để chấm điểm. Nếu chưa đạt, grader nêu vấn đề cụ thể và agent ban đầu làm lại.
Điểm then chốt là grader có ngữ cảnh riêng. Đây không phải để agent tự chấm bài mình. Tự đánh giá gần như chắc chắn dễ cho qua. Một ngữ cảnh sạch giúp phát hiện lỗi mà không bị lệch bởi việc agent cố suy ngược tiêu chuẩn.
Theo Anthropic, thử nghiệm nội bộ cho thấy Outcomes nâng tỷ lệ thành công của nhiệm vụ cao hơn prompt loop tiêu chuẩn tối đa 10 điểm phần trăm, với mức cải thiện lớn hơn ở các nhiệm vụ khó. Trong tình huống tạo tệp, chất lượng docx tăng 8,4% và pptx tăng 10,1%.
Chênh lệch 10 điểm trong benchmark không nhỏ. Nó gần với mức cải thiện mà nhiều đội kỳ vọng khi chuyển sang một thế hệ mô hình mới. Ở đây, phần tăng đến từ cơ chế phối hợp tốt hơn, không phải từ bản thân mô hình.
Outcomes hiện là public beta.
Điều phối đa agent: từ cá nhân sang đội nhóm
Tính năng thứ ba là Multi-agent Orchestration. Nó không gây cảm giác đột phá như Dreaming, nhưng giá trị triển khai rất rõ.
Một lead agent có thể giao việc cho nhiều specialist agent. Mỗi specialist có thể dùng mô hình, prompt và bộ công cụ khác nhau. Toàn bộ tiến độ được theo dõi trong Claude Console.
Ví dụ của Anthropic là điều tra sự cố. Lead agent giao cho bốn sub-agent kiểm tra lịch sử triển khai, error log, metrics và support ticket. Khi bốn nhánh hoàn tất, lead agent tổng hợp kết quả để đưa ra kết luận.
Kiến trúc này gần với cách Anthropic dùng trong hệ thống Code Review nội bộ: nhiều reviewer kiểm tra song song, rồi một verifier riêng chốt lại. Giờ đây họ đóng gói mẫu đó thành sản phẩm cho khách hàng.
Vì sao cả bộ tính năng này đáng chú ý
Nhìn rộng ra, Dreaming giúp agent tự tiến hóa qua nhiều nhiệm vụ, Outcomes giúp agent tự nghiệm thu, còn Multi-agent Orchestration giúp agent điều phối đồng đội.
Đó là một vòng lặp tự học: làm việc, được đánh giá, xem lại, cập nhật trí nhớ, rồi tiếp tục làm việc. Ở giữa không nhất thiết phải có con người can thiệp.
Vì vậy, Code with Claude SF vẫn cho thấy tham vọng của Anthropic dù không công bố mô hình mới. Mục tiêu ở đây lớn hơn một bản nâng cấp kiểu Opus 4.8.
Việc cải thiện benchmark của mô hình ngày càng khó. Mỗi thế hệ tăng thêm 5% đến 10% đã tốn kém hơn. Nhưng năng lực làm việc của agent không chỉ phụ thuộc vào mô hình. Nó còn có thể tăng nhờ cơ chế phối hợp và tích lũy kinh nghiệm. Nếu kiểu học trong thời gian rảnh như Dreaming chạy ổn trong môi trường sản xuất, Anthropic có thêm một đường tăng tốc không chỉ dựa vào scaling law.
Rủi ro cũng không nhỏ. Một agent có thể tự ghi trí nhớ nghĩa là kết luận sai cũng có thể bị cố định. Anthropic đưa ra tùy chọn review bởi con người, nhưng doanh nghiệp có dám mở hoàn toàn tự động hay không vẫn cần vài tháng dữ liệu vận hành.
Dreaming có trở thành tính năng mặc định của thế hệ agent tiếp theo không? Khả năng cao. Memory của OpenAI và Personal Context của Google đã đi theo hướng trí nhớ cá nhân hóa, nhưng Anthropic kéo ý tưởng đó từ sở thích người dùng lên tầng năng lực làm việc của agent. Nếu cách trừu tượng hóa này đứng vững, các đối thủ nhiều khả năng phải theo.
Code with Claude SF còn có các con số khác: 23.000 kỹ sư của Mercado Libre đặt KPI 90% tự động hóa code trước quý III/2026; giới hạn 5 giờ của Claude Code được nhân đôi; lượng gọi API tăng 17 lần so với cùng kỳ năm trước.
Nhưng tín hiệu quan trọng nhất không nằm ở các con số. Đó là agent bắt đầu học cách tự trở nên tốt hơn.
Nguồn tham khảo: Anthropic is letting Claude agents 'dream' so they don't sleep on the job (SiliconANGLE); New in Claude Managed Agents: dreaming, outcomes, and multiagent orchestration (SD Times); CocoLoop; Live blog: Code w/ Claude 2026 (Simon Willison)