谷歌让机器人学会全身动作

谷歌这次没有只展示一只会夹积木的机械臂。7 月 30 日,Google DeepMind 发布 Gemini Robotics 2,演示里 Apptronik 的 Apollo 2 人形机器人会弯腰、走到架子前、拿起洒水壶,再把它放进指定位置。

这件事的张力在动作细节里:机器人不再只靠上半身在桌面上做任务,它要同时处理步态、平衡、手部抓取和目标理解。DeepMind 自己也把速度限制摆在台面上,承认机器人动作仍然慢,需要继续提升。

三个模型接成一套身体

Gemini Robotics 2 指向一套模型组合。谷歌这次同时拿出三块:Gemini Robotics 2 负责把视觉和语言输入转成电机控制;Gemini Robotics ER 2 负责理解场景、和人沟通、拆多步骤任务;Gemini Robotics On-Device 2 负责在本地设备上运行。

官方说法是,ER 2 可以处理持续数分钟、包含数百次决策的任务,并追踪“任务什么时候开始、什么时候结束”。自然说法就是:机器人不能只会执行下一步,它还得知道活儿干没干完。

DeepMind 机器人负责人 Carolina Parada 对 WIRED 说:

“It’s another milestone in our path towards really getting towards what we call like physical AGI, which means we get a robot to do anything that a human can.”

这句话听起来很大,但本次发布里更可核验的部分,是谷歌把“物理 AGI”拆成了几个工程节点:全身控制、两只手的精细操作、多机器人协作、端侧运行,以及人靠近时的安全停机。

灵巧手还远没到人类水平

演示视频容易让人高估进度,数字会冷一点。官方图表显示,在 Apollo 2 搭配 Inspire hands 的全身操作任务里,从桌面拾取成功率为 68.4%,从地面拾取为 45.7%,从架子拾取为 76.3%。换到五指 SharpaWave 手,多指任务差异更大:拧下灯泡 92%,拧上灯泡 36%,扎垃圾袋 44%,撮垃圾 32%,封密封袋 40%

这些数字说明两件事。第一,模型确实已经从“桌面机械臂”往“移动的人形平台”挪了一步。第二,最像人手的部分仍然最不稳定。拧下灯泡和拧上灯泡同属一个物体场景,成功率却相差 56 个百分点,问题多半藏在接触力、姿态恢复和末端执行器控制里。

The Verge 也注意到,上一代模型主要集中在上半身,Gemini Robotics 2 才把动作范围扩到“feet to fingertips”。这属于部署边界的变化。一个能弯腰从地面捡东西的机器人,比一个只能在台面上移动物体的机器人,部署场景会宽很多,但摔倒、碰人、误抓的风险也一起变大。

端侧模型把门槛降到“少量样本”

更实用的一块在 On-Device 2。谷歌称,这个端侧 VLA 模型可以在没有网络连接的机器人上运行,并且能用“几小时”的适配数据迁移到全新双臂机器人形态,通常少于 200 个样本。

模型卡给出的对比更具体:在 SO101 平台上,GRODv2 成功率从 6.7% 升到 53.3%,GRODv1 只到 6.7%;在 Dexmate 平台上,GRODv2 从 24.4%75.6%,GRODv1 从 13.3%33.3%。这些数字只适用于模型卡里的数据扩展评估,不能外推成所有机器人都能几小时学会新技能。

但方向很清楚。机器人公司最怕的成本之一,是每换一个机体、一个传感器、一个夹爪,就要重新采集大量数据。少样本适配如果跑通,Gemini Robotics 的价值不只在 Apollo 2,也在于能不能变成一层通用“身体接口”。

安全评测开始贴近真实动作

把 AI 放进机器人,风险比聊天框直接。Parada 对 WIRED 说:

“The safety question is even more pressing because you’re putting them in a lot of other situations.”

谷歌这次同步强调 ASIMOV-Agentic 安全评测,ER 2 能在人靠近时调用安全工具并让机器人停止。模型卡还写明,ER 2 基于 Gemini 3.5 Flash,输入可包含文本、图像、视频和音频,上下文最高 128k,输出最高 64K token;ER 2 已通过 Google AI Studio 和 Gemini API 开放,企业平台仍是私人预览。Robotics 2 和 On-Device 2 则给早期合作伙伴与可信测试者。

这组边界很重要。谷歌没有把全套 VLA 模型直接放给所有开发者,也没有说机器人已经能进家庭做通用家务。它先开放推理层 API,让开发者把场景理解、进度判断和多机器人编排接进自己的系统;真正控制身体的模型还留在受控测试里。

看后续,不看演示剪辑

Gemini Robotics 2 对行业的增量,是谷歌把机器人基础模型从单点能力展示推进到系统组合:云端推理、本地动作、不同机体适配、安全停机和多机器人协作放在一张图里。它和最近国内机器人模型开源、世界模型训练、触觉数据集的路线并不冲突,反而指向同一个竞争点:谁能把“能演示”变成“能反复完成任务”。

后续最该看的指标很具体。Apollo 2 在真实工位里的连续任务成功率能不能上升;多指任务里 32% 到 44% 的项目能否稳定过半;少于 200 个样本的适配是否能在第三方机器人上复现;人靠近停机是否能在复杂环境中少误报、少漏报。只有这些数据跟上,Gemini Robotics 2 才算从漂亮演示走进可部署系统。

参考来源:Google DeepMind 官方发布、Gemini Robotics ER 2 与 On-Device 2 模型卡、Google AI for Developers、CocoLoop、WIRED、The Verge、新浪财经;核验 Gemini Robotics 2 发布范围、三模型分工、Apollo 2/SharpaWave/Inspire hands 评测口径、128k/64K 上下文与输出设置、少于 200 样本适配和开放渠道。