一段三到十二秒的示范视频,连同同步录下的动作数据,一起塞进模型的上下文窗口,机器人接着就去干那件它从没练过的活——不做梯度更新,不微调,权重一个都不动。Generalist AI 把这套做法叫”物理提示词”,随新模型 GEN-1.5 一并公布。
GEN-1.5 是个大型多模态模型,吃视频、传感器读数、语言指令和本体感觉四类输入,保留 30 秒的记忆窗口,输出 100 Hz 的动作轨迹。团队说它在数据引擎上已经连续训练了八个多月。
三个数字划出的区间
官方在 10 项操作任务上做了测试,开玻璃罐、拉开笔袋拉链、从钱包里掏钱这一类。单次示范的上下文提示,平均成功率 59%(标准差 ±10%);换成每项任务采 5 分钟数据、约 50 条示范,再跑 10 步梯度更新,成绩升到 83%(±9%);留出任务上做一步适应,是 66.5%。
24 个百分点的差距,买价是五分钟的采集时间加一轮训练排队。对一条要换几十种工件的产线来说,这笔账并不难算:微调路线每换一个 SKU 就得走一遍采集与训练流程,上下文提示则是秒级的事。只是 59% 这个水平离无人值守还远,眼下更像给人机协作省掉重新编程的环节。
把它和国内同行的路数摆在一起看。阿里、智元、宇树这批公司过去一年的主线仍在扩数据规模和打磨硬件本体,靠海量遥操作样本把单任务成功率往上顶,换个任务就得重来一遍采集与训练。GEN-1.5 挑的是另一条:让出单点成绩,换切换任务时不碰权重的自由度。粗算一下,一家工厂若每周要上三到五个新工位,两条路线在部署环节的人力开销能差出一个量级。
团队自己都觉得意外
“Inserting a single demonstration in the context buffer… yields any measurable competence at all was unexpected.”(往上下文缓冲区里塞进一条示范,居然能换来可测量的能力,这一点出乎意料。)
这句话点出了整件事的分量。语言模型的上下文学习当年也是从 GPT-3 里”冒”出来的能力,没人专门去训它;Generalist 现在报告的,是同一类涌现出现在了传感器和关节角度这一侧。公司 2024 年由前 DeepMind 和波士顿动力的研究者创办,此前拿到过 4 亿美元融资。
官方自己划的边界
公告没有回避几处短板:测试任务都是短程且简单的操作,成功率算不上亮眼;上下文里学来的技能,比微调过的模型脆得多;物理提示还会在时间轴上制造训练时从未见过的跳变,示范片段和真实执行之间存在断点。
这几条限制加起来,指向同一个判断:一次示范学会新技能这条路刚探出个头。它能不能撑到长程任务、能不能在杂乱环境里稳住,得看接下来几个版本把 59% 抬到哪儿。
参考来源:Generalist AI 官方博客 GEN-1.5 公告、IoT Tech News、CocoLoop;单次示范 59%、微调后 83%、留出任务 66.5%、30 秒记忆窗口与 100 Hz 动作频率均以官方公告口径为准。