清华Zeva不改权重把成功率从26%提到73%

清华大学智能产业研究院(AIR)与域变换联合放出一项具身操作研究,方法叫 Zeva。它的做法在当下这条赛道里不太常见:模型权重全程冻结,不做任何梯度更新,机器人在部署过程中靠上下文自己往上爬。多个具身基准上的累计成功率从 26% 升到 73%。

主流路线是采数据、标数据、微调 VLA 模型,遇到新场景再来一轮。Zeva 把这一整套挪到了推理侧——它记的是动作和状态变化之间的因果关系,然后把这层关系当成提示喂回给冻结的基座模型。论文里用的底座是 Cosmos3。

三个部件

因果转移编码器负责从每次动作里抽出状态变化,把”我做了什么”和”环境变成了什么样”配成对。这一步是整套方法的取数环节,抽得准不准直接决定后面能不能用。

因果记忆分两个时间尺度。短的一层叫简短交互轨迹,只管当前这次尝试;长的一层是持久交互记忆,跨尝试累积。前者解决”这一把我刚试过什么”,后者解决”上一把我在哪儿栽过”。两层分开是有讲究的:当次的失败信号需要立刻反馈到下一个动作,跨次的经验则要经过筛选才进长期记忆,混在一起容易被单次噪声带偏。

第三步是上下文策略注入,把因果提示塞进冻结模型的输入里。整个部署过程零梯度更新。

数字落在哪

在 RoboCasa365-Atomic5 基准上,平均成功率 76.8%。更能说明问题的是搬进真实化学实验室之后的那组数据(团队把这套环境叫 ChemLab-Evo):取试管从 65% 到 100%,放烧杯从 25% 到 70%,倒水从 30% 到 80%。

三项任务的起点相差很大。取试管本来就有 65% 的底子,抬到满分是把剩下的边角磨平;放烧杯从 25% 起步,翻了将近两倍,说明记忆机制在低成功率区间的收益更明显——机器人失败得多,可供归因的因果对也就多。

一次人类演示还能再往上推一截:放烧杯加约 20 个百分点,倒水加约 15 个百分点。一次演示的信息量本来有限,能撬动这个幅度,说明它进的是记忆,不动参数,即插即用。

为什么是化学实验室

选这个场景有实际考量。化学操作的状态变化边界清楚——液面高度、试管位置、有没有洒——因果信号干净,编码器抽出来的配对噪声小。换成折衣服这类状态难以量化的任务,同一套机制未必吃得开,论文没有回避这一点。

对工程侧的意义在于部署形态变了。按微调路线,每进一个新场地就要拉数据、重训、回归验证,一条流水线跑下来以周计。Zeva 这套东西部署完就开始工作,越用越准,代价是推理时上下文更长、单步开销更高。哪种更划算,取决于场景切换的频率——如果一台机器人常年干同一件事,微调仍然是更省的选择。

论文题为《Zeva: In-Context Causal Learning for Generalizable Embodied Manipulation》,参与者包括清华 AIR 的刘云新和曹霆。

参考来源:Zeva 论文原文、量子位、CocoLoop;各项成功率与基准名称按论文披露口径核对,提升幅度为按论文数值直接相减。