同一套指导原则,喂给 gpt-oss-120b 让它的任务完成率涨了 16.1 个百分点,喂给 GLM-5 则一动不动。IBM Research 在 8 月 18 日公开的这组实验测了八个模型,结论落在一句话上:记忆的正确用量取决于模型自身还剩多少余量。
实验用的是 AppWorld 基准,585 个多步任务,其中 168 个走常规难度、417 个走高难度,任务分布在日历、消息、支付等 9 个模拟应用里。
方法本身不复杂:先让智能体把任务跑一遍,从成功和失败的轨迹里提炼出行为层面的指导原则,攒成一个可复用的集合;推理时再把这些原则塞回上下文。塞的方式有两种——整套原则每一步都注入,或者固定一个精简核心、其余按任务检索相关子集。同一套原则,两种投喂方式,对照着看。
三档模型,三种最优解
八个模型跑下来,分层很干净。
余量充足的一档,包括 DeepSeek-V3.2(671B MoE)、Claude Opus 4.6 和 GPT-5.5,整套原则全喂效果最好。DeepSeek-V3.2 的任务完成率涨了 9.5 个百分点,场景完成率涨 16.1 个百分点;Claude Opus 4.6 是 4.1 和 7.1;GPT-5.5 是 2.9 和 7.2。
容量吃紧的一档只有 gpt-oss-120b(117B MoE)。整套灌下去会把它淹掉,换成精选检索之后,两项指标各涨 16.1 个百分点,涨幅是八个模型里最大的。
GLM-5(745B MoE)被归到饱和一档,在这组任务上已经贴近上限,加不加记忆,两项指标都是 0.0 个百分点的变化。
两个指标要分开看
TGC(任务完成率)统计的是智能体把单个任务完整、正确做完的比例。SGC(场景完成率)更狠,一个场景包含同一任务的多个变体——换数据、换措辞、换边界条件——只有每个变体都过了,这个场景才算通过。
分开看的价值就藏在数字里:DeepSeek-V3.2 的 TGC 只涨 9.5 个点,SGC 涨了 16.1 个点。同样的现象在 Claude Opus 4.6(4.1 对 7.1)和 GPT-5.5(2.9 对 7.2)身上都成立。记忆带来的收益更多落在”同一类任务换个说法也能做对”,而非”多做出几道新题”。对做生产系统的人来说,前一种收益比后一种稀缺得多。
代价写在 token 上
开销这一栏是全文最实用的部分。DeepSeek-V3.2 走整套注入,每个任务的 token 消耗从 14.8 万涨到 26.3 万,增幅 78%。gpt-oss-120b 同样走整套,从 11 万涨到 16.6 万,增幅 51%。换成精选检索之后,gpt-oss-120b 的消耗只到 11.6 万,增幅 5%,换来的是 16.1 个百分点。
把这两组数放一起粗算一下性价比:gpt-oss-120b 用 5% 的额外 token 换 16.1 个点,DeepSeek-V3.2 用 78% 的额外 token 换 9.5 个点(TGC 口径)。前者每 1% 的 token 增量对应约 3.2 个百分点,后者约 0.12 个,差了二十多倍。对按 token 计费的线上业务,这个差距足以让”给强模型全量灌记忆”变成一笔算不过来的账。
学习发生在模型外面
作者另有一句话点出了这套方法的边界:
Learning happens around the model, not inside it. 学习发生在模型周围,而非模型内部。
指导原则改的是智能体的上下文环境,模型权重一动不动。好处是随时可加可撤、可审计、换模型就换一套;限制也在这里——所有收益都受上下文窗口和推理成本约束,加到一定程度就会反噬,gpt-oss-120b 被整套原则淹掉便是现成的例子。
这项工作出自 IBM Research,署名作者十人,包括 Vatche Isahagian、Evelyn Duesterwald、Vinod Muthusamy 等,代码与方法挂在 ALTK-Evolve 名下。
对正在给智能体加记忆的团队,这组数据给出的操作顺序比结论更实用:先测模型在目标任务上的基线,看还剩多少余量;余量小的走精选检索,余量大的可以考虑全量;已经贴近天花板的,省下这笔 token 去改别的地方。
参考来源:IBM Research 与 Hugging Face 技术博客、CocoLoop;AppWorld 585 个任务的构成、八款模型的 TGC/SGC 百分点变化与各配置 token 开销均按公开实验数据核对。