Google DeepMind stellte Gemini Robotics 2 am 30. Juli vor. In der Demo beugt sich Apptroniks humanoider Apollo 2, läuft zu einem Regal, hebt eine Gießkanne auf und stellt sie an den vorgegebenen Ort.
Drei Modelle bilden den Stack
Gemini Robotics 2 übersetzt Bild- und Spracheingaben in Motorsteuerung. Gemini Robotics ER 2 versteht Szenen, kommuniziert mit Menschen und plant mehrstufige Aufgaben. Gemini Robotics On-Device 2 läuft lokal auf Roboterhardware.
Carolina Parada sagte WIRED: “It's another milestone in our path towards really getting towards what we call like physical AGI, which means we get a robot to do anything that a human can.” Belastbarer sind die technischen Bausteine: Ganzkörpersteuerung, beidhändige Manipulation, Zusammenarbeit mehrerer Roboter, lokale Ausführung und Sicherheitsstopp.
Die Hand bleibt schwierig
Googles Diagramme zeigen bei Apollo 2 mit Inspire hands 68,4% Erfolg beim Aufheben vom Tisch, 45,7% vom Boden und 76,3% aus dem Regal. Mit der fünffingrigen SharpaWave-Hand lag das Abschrauben einer Glühbirne bei 92%, das Einschrauben bei 36%, das Zubinden eines Müllbeutels bei 44%, Kehrschaufel-Arbeit bei 32% und das Schließen eines Ziplock-Beutels bei 40%.
Die Videos zeigen den Fortschritt, die Zahlen zeigen die Grenze: Je näher die Aufgabe an menschliche Fingerfertigkeit kommt, desto weniger stabil ist das System.
Entscheidend wird die Reproduktion
Google sagt, On-Device 2 könne sich in wenigen Stunden und meist mit weniger als 200 Beispielen an neue zweiarmige Roboterkörper anpassen. Die Modellkarte nennt SO101 mit einem Anstieg von 6,7% auf 53,3% und Dexmate von 24,4% auf 75,6%. Das sind Werte aus der Modellkarten-Evaluation, kein allgemeines Versprechen für jede Plattform.
Die nächsten Prüfsteine sind Drittanbieter-Hardware, stabilere Mehrfingeraufgaben und Sicherheitsstopps, die in unordentlichen Arbeitsumgebungen nicht zu oft auslösen und Menschen trotzdem schützen.
Quellen: Google-DeepMind-Veröffentlichung, Modellkarten zu Gemini Robotics ER 2 und On-Device 2, Google AI for Developers, CocoLoop, WIRED, The Verge, Sina Finance; geprüft wurden Modellumfang, Drei-Modell-Aufbau, Apollo-2/SharpaWave/Inspire-hands-Evaluationsrahmen, 128k/64K-Einstellungen, Anpassung mit weniger als 200 Beispielen und Verfügbarkeitskanäle.