一段三到十二秒的示範影片,連同同步錄下的動作資料,一起塞進模型的上下文視窗,機器人接著就去做那件牠從沒練過的工作——不做梯度更新,不微調,權重一個都不動。Generalist AI 把這套做法稱為「物理提示詞」(physical prompting),隨新模型 GEN-1.5 一併發布。
GEN-1.5 是一個大型多模態模型,接收影片、感測器讀數、語言指令和本體感覺四類輸入,保留30 秒的記憶視窗,輸出100 Hz的動作軌跡。團隊表示,它已經在資料引擎上連續訓練超過八個月。
三個數字劃出的區間
官方在 10 項操作任務上做了測試,像是打開玻璃罐、拉開筆袋拉鍊、從錢包裡掏錢這一類。單次示範的上下文提示,平均成功率59%(標準差 ±10%);換成每項任務蒐集 5 分鐘資料、約 50 筆示範,再跑 10 步梯度更新,成績升到83%(±9%);在保留任務上做一步適應,則是 66.5%。
24 個百分點的差距,代價是五分鐘的蒐集時間加一輪訓練排隊。對一條要換數十種工件的產線來說,這筆帳並不難算:微調路線每換一個 SKU 就得重跑一遍蒐集與訓練流程,上下文提示則只是幾秒鐘的事。只是 59% 這個水準離無人值守還很遠,目前比較像是幫人機協作省下重新編程的環節。
把它和中國同業的路數擺在一起看。阿里巴巴、智元、宇樹這批公司過去一年主軸仍是擴大資料規模與打磨硬體本體,靠大量遠端操作樣本把單一任務成功率往上推,換個任務就得重來一遍蒐集與訓練。GEN-1.5 選的是另一條路:讓出單點成績,換取切換任務時不必動權重的自由度。粗估一下,一家工廠若每週要上線三到五個新工位,兩條路線在部署環節的人力成本可以差到一個數量級。
連團隊自己都覺得意外
"Inserting a single demonstration in the context buffer... yields any measurable competence at all was unexpected."(把一筆示範塞進上下文緩衝區,竟然能換來可量測的能力,這一點出乎意料。)
這句話點出了整件事的份量。語言模型的上下文學習當年也是從 GPT-3 裡「冒」出來的能力,沒有人專門去訓練它;Generalist 現在報告的,是同一類湧現出現在了感測器與關節角度這一側。這家公司 2024 年由前 DeepMind 與波士頓動力(Boston Dynamics)的研究員創辦,先前已募得 4 億美元資金。
官方自己劃的界線
公告沒有迴避幾個短板:測試任務都是短程且簡單的操作,成功率算不上亮眼;從上下文裡學來的技能,比經過微調的模型脆弱得多;物理提示還會在時間軸上製造訓練時從未見過的跳動,示範片段與實際執行之間存在斷點。
這幾條限制加總起來,指向同一個判斷:靠一次示範學會新技能這條路,才剛探出個頭。它能不能撐到長時程任務、能不能在雜亂環境裡站穩,得看接下來幾個版本能把 59% 拉到哪裡。
參考來源:Generalist AI 官方部落格 GEN-1.5 公告、IoT Tech News、CocoLoop;單次示範 59%、微調後 83%、保留任務 66.5%、30 秒記憶視窗與 100 Hz 動作頻率,皆以官方公告數據為準。