Google DeepMind hat mit Gemini Robotics ER 2 sein bislang leistungsfähigstes KI-Modell für die Robotik vorgestellt. Das System fungiert als hochentwickeltes Gehirn für Maschinen und ermöglicht echtes Verständnis der physischen Welt in Echtzeit. Werfen wir einen Blick auf die Details, die diesen Release so besonders machen.
Von der Planung zur Aktion: Gemini Robotics ER 2 als digitales Kontrollzentrum
Stellen Sie sich Gemini Robotics ER 2 als hochrangiges Nervenzentrum für Roboter vor. Das Modell ermöglicht es Maschinen, mit Menschen zu kommunizieren, ihre Umgebung zu verstehen und komplexe Aufgaben in mehrere Schritte zu unterteilen. Anschließend übergibt es die konkrete Motorik an darunterliegende Vision-Language-Action-Modelle (VLA).
Besonders innovativ: Das System kann parallel zu laufenden Aktionen über nächste Schritte nachdenken. Zudem lassen sich externe Werkzeuge wie die Google-Suche oder benutzerdefinierte Funktionen nahtlos einbinden.
Temporale Intelligenz für robuste Aufgabenbewältigung
Eine der größten Herausforderungen in der Robotik ist die Einschätzung, wann eine Aufgabe wirklich abgeschlossen ist. Gemini Robotics ER 2 bringt hier einen Quantensprung im Bereich Video-Analyse und Fortschrittstracking.
Fortschrittsklassifizierung in Echtzeit
Durch die kontinuierliche Analyse von Videofeeds ordnet das Modell jeden Frame einem von fünf Fortschrittsstufen zu. Mit einer Genauigkeit von 57,4 Prozent erkennt das System, wie weit eine Aufgabe wie das Festziehen einer Glühbirne oder das Verschließen eines Müllbeutels bereits fortgeschritten ist. Fehler lassen sich so frühzeitig erkennen und korrigieren, ohne den gesamten Workflow neu starten zu müssen.
Präzises Moment-Finding
Das Moment-Finding bestimmt den exakten Zeitpunkt, zu dem ein Roboter die nächste Aufgabe starten sollte. Ob beim Eingießen von Kaffee oder dem Verifizieren eines Arbeitsschrittes – mit 91,3 Prozent Genauigkeit und einer durchschnittlichen Latenz von nur 0,96 Sekunden arbeitet das System deutlich schneller als Vorgängermodelle und Konkurrenzsysteme.
Mehrere Roboter, ein gemeinsames Verständnis
Ein einzelner Roboter kann nicht alles. Mit der neuen Multi-Robot-Collaboration kommunizieren unterschiedliche Maschinen über eine gemeinsame semantische Ebene und übergeben Aufgaben nahtlos aneinander. Ein fahrerloser Transporter kann beispielsweise Objekte transportieren, während ein humanoider Roboter sie an der Zielstelle manipuliert.
Verbesserte räumliche Intelligenz und Sicherheit
Gemini Robotics ER 2 arbeitet nicht mehr mit statischen Einzelbildern, sondern analysiert rohe Videoströme. So erkennt es Ausführungsfehler wie Verschütten oder Verrutschen noch während des Prozesses. Zudem liest es verschiedenste Instrumente – von analogen Skalen über digitale Displays bis hin zu Flüssigkeitsthermometern.
Im Bereich Sicherheit erzielt das Modell Bestwerte bei der Einhaltung physischer Grenzen und der Erkennung menschlicher Nähe. Nähert sich eine Person, stoppt ein humanoider Roboter autonom seine Arbeit und setzt sie erst fort, wenn der Bereich wieder frei ist.
Verfügbarkeit und Zugang für Entwickler
Google stellt Gemini Robotics ER 2 über die Gemini API und Google AI Studio öffentlich zur Verfügung. Für Unternehmenskunden gibt es zudem eine private Vorschau über die Gemini Enterprise Agent Platform.
Quelle: Google DeepMind Blog