Google DeepMind 7月30日發布Gemini Robotics 2。演示裡,Apptronik的Apollo 2人形機器人會彎腰、走到架子前、拿起灑水壺,再放進指定位置。
三個模型接成一套身體
Gemini Robotics 2負責把視覺和語言輸入轉成馬達控制;Gemini Robotics ER 2負責理解場景、溝通與拆解多步驟任務;Gemini Robotics On-Device 2則讓模型在本地設備上運行。Google稱ER 2能處理持續數分鐘、包含數百次決策的任務。
Carolina Parada對WIRED說:“It's another milestone in our path towards really getting towards what we call like physical AGI, which means we get a robot to do anything that a human can.” 可核驗的進展更具體:全身控制、雙手操作、多機器人協作、本地執行與安全停機。
靈巧手仍是短板
官方圖表顯示,Apollo 2搭配Inspire hands時,從桌面拾取成功率為68.4%,從地面拾取45.7%,從架子拾取76.3%。使用五指SharpaWave手時,擰下燈泡達92%,擰上燈泡36%,紮垃圾袋44%,撮垃圾32%,封密封袋40%。
這些數字比演示影片更冷靜。模型確實跨出桌面操作,但越接近人手的細節,穩定性越不夠。
後續看第三方復現
On-Device 2被設計成無網路也能在機器人上運行。Google稱它能用幾小時資料、通常少於200個樣本,適配新的雙臂機器人形態。模型卡裡,SO101成功率從6.7%升至53.3%,Dexmate從24.4%升至75.6%。這只是模型卡評測口徑,不等同所有機器人都能達到。
接下來要看少樣本適配能否在第三方硬體上重現,多指任務能否穩定過半,人靠近時的安全停機能否在複雜環境中少誤報、少漏報。
參考來源:Google DeepMind官方發布、Gemini Robotics ER 2與On-Device 2模型卡、Google AI for Developers、CocoLoop、WIRED、The Verge、新浪財經;核驗Gemini Robotics 2發布範圍、三模型分工、Apollo 2/SharpaWave/Inspire hands評測口徑、128k/64K設定、少於200樣本適配與開放渠道。