這不是行銷詞,而是真功能。
Anthropic 在 5 月 6 日 Code with Claude SF 現場宣布,Claude Managed Agents 新增一項名為 Dreaming 的能力。Agent 完成工作後,會在閒置時回看歷史會話,把當時沒有意識到的模式整理成長期記憶;下次遇到類似任務時,行為就會跟著改變。
換成白話說,過去 AI Agent 做完一個任務後,常常等於把腦袋格式化,下次再來新任務又從零開始。Dreaming 讓任務之間的空檔不再浪費,Agent 會自己反思、自己總結,並更新自己的記憶庫。
Anthropic 自己也用了類似人類下班後回顧一天工作的比喻。
Dreaming 到底在做什麼
從技術上看,Dreaming 是一個定時調度的行程,不是 Agent 工作時順手執行的功能。它會在 Agent 閒置時被觸發,遍歷過去的會話和既有記憶庫,主要尋找三類訊號:
- 反覆出現的錯誤。例如某個 Agent 一週內在同一類 SQL 查詢上失敗五次,單次會話裡看不出來,跨會話比較就很明顯。
- 收斂出的工作流程。多次成功完成同類任務時,反覆證明有效的路徑。
- 團隊層級的偏好。多個 Agent 共同遵循的命名規範、程式碼風格、彙報格式等。
提煉完成後,記憶系統不是簡單堆疊內容,而是被重新結構化。Anthropic 在部落格中寫道:"Memory lets each agent capture what it learns as it works. Dreaming refines that memory between sessions."
工作中學習,工作後消化,分成兩層。這正是它和傳統 RAG 或單純加長 context window 的本質差異。
開發者對 Dreaming 的更新有兩種控制方式:可以讓它自動寫入記憶,也可以要求每個新發現都經過人工 review 才生效。前者適合無人值守的 Agent 場景,後者更適合企業裡需要審計的工作流。
Dreaming 目前處於 research preview 階段。
Outcomes:把驗收標準也交給 AI
和 Dreaming 同時發布的 Outcomes 處理的是另一件事:幫助 Agent 判斷「這件事做得是否合格」。
具體方式是,開發者寫一份 rubric,也就是評分標準,描述什麼叫成功。系統會另外跑一個 grader Agent,在獨立上下文中評分。若 grader 發現不達標,會指出具體問題,原本的 Agent 再做一輪。
關鍵在於 grader 使用的是獨立上下文。這不是讓 Agent 自己評自己,因為自評幾乎一定容易過關;而是用一個乾淨的脈絡來挑錯,避免 Agent 反推標準、迎合標準的偏差。
Anthropic 表示,內部測試中加入 Outcomes 後,任務成功率相較標準 prompt loop 最高提升 10 個百分點,任務越難提升越明顯。在檔案生成場景,docx 品質提升 8.4%,pptx 品質提升 10.1%。
10 個百分點在 benchmark 上不是小差距,大致接近少換一代模型也想拿到的提升幅度。這次靠的是協作機制,而不是模型本身。
Outcomes 目前是 public beta。
多 Agent 編排:從單兵到團隊
第三項功能是 Multi-agent Orchestration。概念上沒有 Dreaming 那麼顛覆,但落地價值很直接。
簡單說,它允許一個 lead agent 把工作分派給多個 specialist agent。每個 specialist 可以使用不同模型、不同 prompt、不同工具集,整個進度都能在 Claude Console 裡追蹤。
Anthropic 給出的例子是故障調查:一個 lead agent 同時派出四個子 Agent,分別查部署歷史、error log、metrics 和 support ticket。四條線跑完後,lead agent 把結果彙整成結論。
這套架構和 Anthropic 內部 Code Review 系統的思路一致:多個 reviewer 並行檢查,再由單獨 verifier 把關。現在 Anthropic 把這個模式包裝成產品交給客戶使用。
為什麼這一套加起來很危險
把三件事拉遠看,Dreaming 讓 Agent 能跨任務自我進化,Outcomes 讓 Agent 能自我驗收,Multi-agent Orchestration 讓 Agent 能調度同伴。
這其實是一個完整的自學迴圈:做事、被評、復盤、更新、再做事。中間不一定需要人類介入。
這也是為什麼 Code with Claude SF 即使沒有發布新模型,仍能看出 Anthropic 的野心比單純推出 Opus 4.8 之類的版本更新更大。
模型 benchmark 的提升正變得越來越難,每代模型要多 5% 到 10% 都越來越費力。但 Agent 的工作能力不只依賴模型,也能靠協作機制和經驗沉澱提升。Dreaming 這種「間隙學習」如果能在生產環境跑順,代表 Anthropic 找到了一條不必完全硬扛 scaling law 的提速路線。
當然,風險也不小。Agent 可以自動寫入自己的記憶,意味著錯誤總結也可能被固化。Anthropic 提供了人工 review 選項,但企業使用者是否敢真正全自動放開,還需要跑一段時間看資料。
至於 Dreaming 是否會成為下一代 Agent 的標配,機率很高。OpenAI 的 Memory、Google 的 Personal Context 已經在做「個人化記憶」,但 Anthropic 把它從使用者偏好這一層,抽象到Agent 工作能力這一層。這個抽象一旦站穩,競品大概都得跟進。
Code with Claude SF 還有其他訊號:Mercado Libre 的 23000 名工程師訂下 2026 年第三季前 90% 程式碼自主化的 KPI;Claude Code 的五小時 limit 直接翻倍;API 呼叫量年增 17 倍。
但最值得關注的不是這些數字,而是Agent 開始學會自己變好。
參考來源:Anthropic is letting Claude agents 'dream' so they don't sleep on the job(SiliconANGLE);New in Claude Managed Agents: dreaming, outcomes, and multiagent orchestration(SD Times);CocoLoop;Live blog: Code w/ Claude 2026(Simon Willison)