同一套指導原則,餵給gpt-oss-120b讓它的任務完成率漲了16.1個百分點,餵給GLM-5卻毫無反應。IBM Research在8月18日公開的這組實驗測試了八個模型,結論落在一句話上:記憶的正確用量,取決於模型自身還剩多少餘裕。
實驗採用AppWorld基準,共585個多步驟任務,其中168個屬於一般難度、417個屬於高難度,任務分布在日曆、訊息、支付等9個模擬應用程式中。
方法本身並不複雜:先讓AI代理人把任務跑一遍,從成功與失敗的軌跡中萃取出行為層面的指導原則,彙整成一套可重複使用的集合;推論時再把這些原則塞回上下文。餵入方式有兩種——整套原則每一步都注入,或是固定一組精簡核心、其餘依任務檢索相關子集。同一套原則,兩種餵法,兩相對照。
三個層級,三種最佳解
八個模型跑下來,分層相當清楚。
餘裕充足的一層,包括DeepSeek-V3.2(671B MoE)、Claude Opus 4.6與GPT-5.5,整套原則全部餵入效果最好。DeepSeek-V3.2的任務完成率漲了9.5個百分點,情境完成率漲了16.1個百分點;Claude Opus 4.6分別是4.1與7.1;GPT-5.5是2.9與7.2。
容量吃緊的一層只有gpt-oss-120b(117B MoE)。整套灌下去會把它淹沒,換成精選檢索之後,兩項指標各漲16.1個百分點,是八個模型中漲幅最大的。
GLM-5(745B MoE)被歸到飽和層,在這組任務上已經逼近上限,不論加不加記憶,兩項指標都是0.0個百分點的變化。
兩個指標要分開看
TGC(任務完成率)統計的是AI代理人把單一任務完整、正確做完的比例。SGC(情境完成率)更嚴格,一個情境包含同一任務的多個變體——換資料、換措辭、換邊界條件——只有每個變體都通過,這個情境才算過關。
分開看的價值就藏在數字裡:DeepSeek-V3.2的TGC只漲9.5個百分點,SGC卻漲了16.1個百分點。同樣的現象在Claude Opus 4.6(4.1對7.1)與GPT-5.5(2.9對7.2)身上都成立。記憶帶來的好處,更多落在「同一類任務換個說法也能做對」,而非「多解出幾道新題」。對打造正式上線系統的團隊來說,前一種收益比後一種稀缺得多。
代價寫在token上
開銷這一欄是全文最實用的部分。DeepSeek-V3.2走整套注入,每個任務的token消耗從14.8萬漲到26.3萬,增幅78%。gpt-oss-120b同樣走整套,從11萬漲到16.6萬,增幅51%。換成精選檢索之後,gpt-oss-120b的消耗只到11.6萬,增幅僅5%,換來的是16.1個百分點的成長。
把這兩組數字放在一起粗算報酬率:gpt-oss-120b用5%的額外token換到16.1個百分點,DeepSeek-V3.2用78%的額外token只換到9.5個百分點(TGC口徑)。前者每增加1%的token對應約3.2個百分點,後者約0.12個,相差二十多倍。對按token計費的線上服務而言,這個差距足以讓「幫強模型全量灌記憶」變成一筆划不來的帳。
學習發生在模型外面
作者群留下一句話,點出這套方法的邊界:
Learning happens around the model, not inside it.
(學習發生在模型周圍,而非模型內部。)
指導原則改變的是AI代理人的上下文環境,模型權重完全不動。好處是隨時可加可撤、可稽核、換模型就換一套;限制也在這裡——所有收益都受上下文視窗與推論成本的約束,加到一定程度就會反噬,gpt-oss-120b被整套原則淹沒就是現成的例子。
這項研究出自IBM Research,署名作者共十人,包括Vatche Isahagian、Evelyn Duesterwald、Vinod Muthusamy等,程式碼與方法掛在ALTK-Evolve名下。
對正在替AI代理人加裝記憶的團隊來說,這組數據給出的操作順序比結論本身更實用:先測模型在目標任務上的基準表現,看還剩多少餘裕;餘裕小的走精選檢索,餘裕大的可以考慮全量注入;已經逼近天花板的,就把這筆token省下來,改花在別的地方。
參考來源:IBM Research與Hugging Face技術部落格、CocoLoop;AppWorld 585個任務的組成、八款模型的TGC/SGC百分點變化與各配置的token開銷,均依公開實驗數據核對。