Google DeepMindは7月30日、Gemini Robotics 2を発表した。デモではApptronikのApollo 2が腰を曲げ、棚まで歩き、じょうろを拾って指定された場所に置く。
三つのモデルで身体を動かす
Gemini Robotics 2は視覚と言語をモーター制御へ変換する。Gemini Robotics ER 2は環境理解、会話、複数手順の計画を担う。Gemini Robotics On-Device 2はネット接続なしでもロボット上で動く。
Carolina Parada氏はWIREDに “It's another milestone in our path towards really getting towards what we call like physical AGI, which means we get a robot to do anything that a human can.” と語った。大きな表現だが、確認できる進歩は全身動作、両手操作、複数ロボット協調、ローカル実行、安全停止に分かれる。
手先の成功率はまだばらつく
公式図表では、Apollo 2とInspire handsの組み合わせで、机上から拾う成功率は68.4%、床からは45.7%、棚からは76.3%。五指のSharpaWave手では、電球を外す作業が92%に達した一方、電球をねじ込む作業は36%、ごみ袋を結ぶ作業は44%、ちり取り作業は32%、ジップ袋を閉じる作業は40%だった。
動画は進歩を見せるが、数字は課題も示す。人間らしい手の動きほど安定していない。
次は再現性を見る段階
On-Device 2は数時間、通常200例未満のデータで新しい双腕ロボット形態へ適応できるとされる。モデルカードではSO101が6.7%から53.3%、Dexmateが24.4%から75.6%へ上がった。ただし、これは評価条件内の結果で、すべてのロボットへの一般化ではない。
今後の焦点は、第三者ハードウェアで少数例適応が再現するか、低い多指タスクが過半を超えるか、人の接近時の安全停止が複雑な現場でも機能するかだ。
情報源:Google DeepMind公式発表、Gemini Robotics ER 2およびOn-Device 2モデルカード、Google AI for Developers、CocoLoop、WIRED、The Verge、Sina Finance;モデル範囲、三モデル構成、Apollo 2/SharpaWave/Inspire hands評価条件、128k/64K設定、200例未満の適応、提供経路を確認。