Anthropic於8月26日發布一篇關於Warp的工程復盤,說明這家公司如何讓自家AI代理持續修正行為,卻完全不去動模型權重。
Warp做的是AI終端機與代理開發環境,2020年成立,創辦人為Zach Lloyd,累計募資7300萬美元。公司公布的使用數據顯示,月活躍開發者達80萬人,財星500大企業中有56%曾使用過其產品;Claude Code在Warp內累計執行超過1000萬次工作階段,目前每週超過40萬次,平台上的AI代理對話總量已達4000萬次。
三層架構
拆開來看,這套機制其實只有三個部分。
最內層是基礎技能,一份寫著領域知識與操作規則的檔案,例如程式碼審查該檢查哪些重點、什麼情況算是阻擋性問題。中間層是人類回饋,也就是開發者對AI代理輸出結果的評價。最外層則是一個改寫代理,Warp內部稱之為improver skill,它唯一的工作就是定期彙整回饋,對基礎技能提出小幅修改建議。
Lloyd對這個架構的說法是:
"There's the base domain-specific skill and then there's the improver skill that refines that domain-specific skill. This simplicity is the beauty of this approach."
意譯:一層是基礎的領域專屬技能,另一層則是負責打磨它的改進技能,簡單本身就是這套做法的優點。
技能以檔案形式存放,採用的是Claude平台的Agent Skills API。這個選擇帶來的連鎖效應比聽起來更大。檔案能被AI代理直接編輯,也能納入Git版控,改寫代理提出的每一次修改都以一般程式碼變更的形式,走團隊既有的審查流程。人可以否決、可以回滾,也能在diff裡清楚看到AI代理替自己新增了哪一條規則。把知識寫進檔案系統,而不是堆進提示詞裡,這一步讓「模型今天又為什麼變了」變成一次可追溯的提交紀錄。
這裡有個容易被忽略的前提:三層架構裡最外層的那一層,本身也是一份技能檔案。改寫代理自己怎麼讀取回饋、怎麼判斷該不該修改、一次能改多少,同樣寫在檔案裡,同樣能被人改動。整套系統沒有黑盒子,一旦出問題,順著這兩份檔案就能一路查到底。
回饋品質決定上限
Warp的程式碼審查代理剛上線時,準確率大約80%,剩下那兩成就靠這條迴路慢慢補上。Lloyd強調的重點在於回饋的形式:一句「這篇審查不好」沒有用,「詳細說明這篇程式碼審查為什麼不好的理由」才能真正推動學習。
難處在於,寫出詳細理由要花時間,而開發者正忙著處理自己手上的工作。Warp的做法是把回饋的輸入門檻降到極低,Lloyd原話是「Low friction is what keeps signal flowing」,摩擦愈低,訊號才流得動。這一點比三層架構本身更難落實:架構一週就能搭好,但要讓團隊長期持續留下有資訊量的評價,是個產品設計層面的課題。
這套做法的邊界
粗略算一下這條迴路的經濟效益:改寫代理只在回饋累積到一定量時才會執行一次,每次讀取的是彙整後的回饋,加上一份幾百到幾千token的技能檔案,最後產出的是幾行diff。跟微調模型相比,成本低到幾乎可以忽略;代價則是能改動的只有寫在檔案裡的明文規則,模型本身的判斷偏好動不了。
所以它比較像是替AI代理配了一本活的操作手冊,而不是讓模型變聰明。適合的場景是規則明確、回饋密集、對錯能夠判定的任務:程式碼審查、工單分類、格式轉換。一旦碰到需要模型改變底層判斷的工作,這條迴路就走到了盡頭。
對多數團隊來說,這個天花板算不上什麼問題。絕大多數AI代理在正式環境中犯的錯,都出在規則沒寫清楚,跟模型能力強弱關係不大。把規則寫清楚這件事,過去得靠人一遍又一遍地改寫提示詞,現在則多了一個會自己動手寫、而且修改內容都攤在審查台面上的合作夥伴。
參考來源:Anthropic官方部落格的Warp工程復盤、CocoLoop、Warp公開的產品與募資資訊;工作階段數、準確率與募資金額均依其公開揭露的口徑記錄。