清華Zeva不改權重 成功率26%衝上73%

清華大學智慧產業研究院(AIR)與域變換聯合發布一項具身操作研究,方法叫做Zeva。它的做法在這個領域裡不算常見:模型權重全程凍結,不做任何梯度更新,機器人在部署過程中單靠情境脈絡自己往上爬。在多個具身基準測試上,累積成功率從26%升到73%。

主流路線是收資料、標資料、微調VLA模型,遇到新場景就再跑一輪。Zeva把這整套流程搬到了推論端——它記錄的是動作與狀態變化之間的因果關係,接著把這層關係當成提示詞餵回凍結的基座模型。論文裡採用的基座是Cosmos3。

三個部件

因果轉移編碼器負責從每次動作裡萃取狀態變化,把「我做了什麼」跟「環境變成什麼樣」配成一對。這一步是整套方法取得資料的環節,抽取得準不準,直接決定後面能不能用。

因果記憶分成兩個時間尺度。短的一層叫做簡短互動軌跡,只管當下這次嘗試;長的一層是持續互動記憶,跨嘗試累積下來。前者解決「這一輪我剛剛試過什麼」,後者解決「上一輪我在哪裡跌倒」。把兩層分開是有講究的:當次的失敗訊號得立刻反映到下一個動作上,跨次的經驗則要先篩選過才能進長期記憶,混在一起容易被單次雜訊帶偏。

第三步是情境內策略注入,把因果提示塞進凍結模型的輸入裡。整個部署過程中,梯度更新次數是零。

數字落在哪裡

在RoboCasa365-Atomic5基準上,平均成功率76.8%。更能說明問題的是搬進真實化學實驗室之後那組數據(團隊把這套環境稱為ChemLab-Evo):拿試管從65%升到100%,放燒杯從25%升到70%,倒水從30%升到80%。

三項任務的起點相差很大。拿試管本來就有65%的底子,把它拉到滿分,做的其實是把邊角案例磨平。放燒杯從25%起步,幾乎翻了兩倍,說明記憶機制在成功率偏低的區間收益更明顯——機器人失敗得愈多,可供歸因的因果配對也就愈多。

加一次人類示範,還能再往上推一截:放燒杯多加約20個百分點,倒水多加約15個百分點。一次示範本身能帶的資訊量有限,卻能撬動這樣的幅度,說明它進的是記憶,沒動到參數,屬於即插即用。

為什麼選化學實驗室

選這個場景是有實際考量的。化學操作的狀態變化邊界清楚——液面高度、試管位置、有沒有灑出來——因果訊號乾淨,編碼器抽出來的配對雜訊也小。換成摺衣服這類狀態難以量化的任務,同一套機制未必吃得開,論文並沒有迴避這一點。

對工程端來說,意義在於部署的形態變了。照微調路線走,每進一個新場地就要拉資料、重新訓練、跑回歸驗證,一整條流程跑下來要以週計算。Zeva這套東西部署完就開始運作,愈用愈準,代價是推論時情境變長、單步開銷也變高。哪一種比較划算,要看場景切換的頻率——如果一台機器人常年做同一件事,微調仍然是比較省的選擇。

論文題為《Zeva: In-Context Causal Learning for Generalizable Embodied Manipulation》,參與者包括清華AIR的劉雲新與曹霆。

參考來源:Zeva論文原文、量子位、CocoLoop;各項成功率與基準名稱按論文揭露口徑核對,提升幅度為依論文數值直接相減而得。