- Google DeepMind hat die Modellfamilie Gemini Robotics 2 vorgestellt, die visuelle und sprachliche Eingaben in Aktionen umwandelt, Humanoide von den Füßen bis zu den Fingerspitzen steuert und präzise Manipulation sowie Zusammenarbeit zwischen Robotern unterstützt
- Die Modellfamilie besteht aus Gemini Robotics 2 als VLA für Ganzkörpersteuerung, Gemini Robotics ER 2 für Planung und Überwachung langfristiger Aufgaben sowie Gemini Robotics On-Device 2 für die lokale Ausführung auf Robotern
- Humanoide können Gehen, Bücken und das Tragen von Objekten verknüpfen, mit einer fünffingrigen Hand mit 22 Freiheitsgraden Knoten binden oder Zip-Beutel verschließen, und mehrere Roboter können bei Aufgaben kooperieren, die einzeln schwer zu bewältigen sind
- On-Device 2 läuft ohne Netzwerkverbindung und lässt sich typischerweise mit weniger als 200 Beispielen und nur wenigen Stunden Anpassung auf neue Dual-Arm-Roboter mit stark abweichender Form, Sensorik und Freiheitsgraden übertragen
- ER 2 ist als Private Preview in Google AI Studio und auf der Gemini Enterprise Agent Platform verfügbar; die VLA- und On-Device-Modelle stehen Early-Access-Partnern offen, aber Bewegungsgeschwindigkeit und Präzision müssen weiterhin verbessert werden
Drei Robotermodelle mit unterschiedlichen Rollen
- Bisherige Roboter wurden meist für enge, repetitive Arbeitsabläufe vorprogrammiert oder per Teleoperation gesteuert, weshalb sie sich nur schwer selbstständig an unvorhersehbare Umgebungen anpassen oder Fähigkeiten von einem Robotertyp auf einen anderen übertragen können
- Gemini Robotics 2 ist ein Vision-Language-Action-Modell (VLA), das visuelle und sprachliche Eingaben in Motorsteuerung umwandelt
- Steuert sowohl den gesamten Humanoiden als auch Dual-Arm-Roboter
- Unterstützt präzise Manipulation mit beiden Händen und Greifern
- Gemini Robotics ER 2 ist ein Embodied-Reasoning-Modell (ER), das die Agentenrolle des Roboters übernimmt
- Kommuniziert mit Menschen und versteht die physische Umgebung
- Plant mehrstufige Aufgaben, die sich über Minuten erstrecken
- Unterstützt Teamarbeit mehrerer Roboter
- Gemini Robotics On-Device 2 ist ein effizientes VLA, das für die lokale Ausführung direkt auf dem Roboter optimiert wurde
- Kann sich mit nur wenigen Stunden Daten an völlig neue Roboterformen anpassen
- Der Verfügbarkeitsumfang unterscheidet sich je nach Modell
- ER 2 ist in Google AI Studio nutzbar und wird auf der Gemini Enterprise Agent Platform als Private Preview angeboten
- Die VLA- und On-Device-Modelle werden Early-Access-Partnern bereitgestellt
- Wie die Hardware-Anbindung erfolgt, beschreibt der Developer blog
Ganzkörpersteuerung für Humanoide über den Oberkörper hinaus
- Während sich das vorherige Modell auf die Steuerung des humanoiden Oberkörpers für Tischaufgaben konzentrierte, erweitert Gemini Robotics 2 den Steuerungsbereich auf Ganzkörperbewegungen
- Apptronik Apollo 2 kann die Anweisung „Stell die Gießkanne in die grüne Kiste im unteren Regal“ ausführen
- Geht zum Tisch und greift die Gießkanne
- Bewegt sich zum Regal und stellt sie präzise an der vorgegebenen Stelle ab
- Es verknüpft Gehen, Bücken, Balancieren und Objektmanipulation, um Aufgaben in engen und unaufgeräumten Räumen auszuführen, doch die Bewegungsgeschwindigkeit muss weiter verbessert werden
Präzise Manipulation mit Händen und Greifern
- Steuert die fünf Finger und 22 Freiheitsgrade der an Apollo 2 montierten SharpaWave-Hand
- Führt feinmotorische Bewegungen wie das Binden eines Knotens aus
- Kann einen Zip-Beutel verschließen
- Bewältigt auch komplexe Aufgaben wie das dichte Verpacken von Gegenständen mit dem standardmäßigen 2-Finger-Parallelgreifer von Franka Duo
- Um menschliches Geschick zu erreichen, müssen Präzision und Geschwindigkeit weiter gesteigert werden
Langfristiges Aufgabenverständnis und Multi-Roboter-Kollaboration
- Gemini Robotics ER 2 dient als übergeordnetes Gehirn des Roboters, verarbeitet Benutzeranweisungen und kommuniziert mit Menschen
- Beobachtet den Raum und leitet die nötigen Schritte ab
- Koordiniert mit dem VLA die tatsächlichen Aktionen
- Verfolgt den Fortschritt bis zum Abschluss
- Wenn bei der Ausführung komplexer mehrstufiger Aufgaben ein Schritt fehlschlägt, kann es sich selbst korrigieren und auf neue Situationen und Ziele generalisieren
- Es trifft in einer einzigen Aufgabe Hunderte von Entscheidungen und verarbeitet Arbeitsabläufe, die sich über Minuten erstrecken, stabiler als zuvor
- Es versteht Beginn und Ende einer Aufgabe und identifiziert den Zeitpunkt zentraler Ereignisse, um den Fortschrittsstatus nachzuverfolgen
- Durch Kommunikation und Zusammenarbeit verschiedener Robotertypen lassen sich komplexe Arbeitsabläufe bewältigen, die für einen einzelnen Roboter nur schwer ausführbar sind
Schnelle Anpassung an neue Roboterformen
- Gemini Robotics On-Device 2 wird lokal ausgeführt auf dem Roboter für Umgebungen, in denen ohne Netzwerklatenz oder Internetverbindung gearbeitet werden muss
- Es unterstützt mehrere Roboterformen nativ und übernimmt die Motion-Transfer-Technik von Gemini Robotics 1.5
- Typischerweise lässt es sich mit weniger als 200 Beispielen und nur wenigen Stunden Anpassung auf neue Dual-Arm-Roboter anwenden
- Es passt sich auch an Roboter mit stark unterschiedlichem Aufbau, Sensoren und Freiheitsgraden an und erledigt verschiedene Aufgaben auf den Plattformen Dexmate, SO101 und Trossen
Robotersicherheit auch unter Unsicherheit
- Mit den wachsenden physischen Fähigkeiten von Robotern kommt ein mehrschichtiger Sicherheitsansatz zum Einsatz, der klassische physische Schutzmaßnahmen mit AI-Sicherheitsframeworks kombiniert
- ASIMOV-Agentic ist ein neuer Benchmark zur Bewertung von Agentensicherheits-Koordination und dem Umgang mit Unsicherheit
- Misst, ob ein Embodied-Reasoning-Agent unsichere vom VLA angeforderte Tool-Aufrufe ablehnen kann
- Bewertet, ob die Ausführbarkeit einer Aufgabe korrekt vorhergesagt wird und bei Unsicherheit proaktiv menschliches Eingreifen angefordert wird
- Gemini Robotics ER 2 zeigt bei der Einhaltung von Sicherheitsbeschränkungen und bei Benchmarks zur Menschennähe die sicherste Leistung unter den bisherigen Robotermodellen von Google DeepMind
- Erkennt Menschen in der Umgebung besser
- Ruft Sicherheits-Tools auf und stoppt den Roboter sicher, wenn sich Menschen zu stark nähern
- Eine Fähigkeit, die von kollaborativen Sicherheitsstandards für die Arbeit mit Menschen gefordert wird
- Detaillierte Bewertungen finden sich im Gemini Robotics 2: Safety Technical Report
- Ziel ist der Aufbau der Kernintelligenz für allgemeine physische AI, die über die Automatisierung einzelner Aufgaben hinaus gemeinsam mit Menschen komplexe Probleme löst
1 Kommentare
Meinungen auf Hacker News
Als DeepMind-Forscher, der an der Entwicklung dieses Modells beteiligt war: DeepMind ist ein guter Arbeitsplatz. Es ist eines der wenigen einzigartigen Forschungslabore, in denen man zwischen fast allen Bereichen rund um Intelligenz wechseln kann – Gemini/Gemma, Robotik, Wissenschaften wie Wetter und Biologie – und es gibt viele großartige Kolleginnen und Kollegen. Ein Beitritt ist also durchaus eine Überlegung wert
Anthropic und OpenAI bekommen 80 % der Aufmerksamkeit, aber die Bandbreite, die Google abdeckt – von Frontier-tauglichen, schnellen Modellen mit offenen Gewichten bis hin zu Bild-, Video- und Musikgenerierung sowie Robotik – ist beeindruckend
Die Bewegungen des Roboters sind langsam und nicht geschmeidig, aber auch das frühe ChatGPT wirkte sehr träge. Wenn sich das so schnell wie LLMs weiterentwickelt, könnte der Einsatzbereich in wenigen Jahren enorm wachsen
Langsame, statische Roboterbewegungen und schnelle, flexible Bewegungen sind vom Schwierigkeitsgrad her völlig verschieden. Bei schnellen Bewegungen müssen Rotationsträgheit mehrerer Gelenke und Massen sowie Gleichgewichtsänderungen hunderte bis tausende Male pro Sekunde berechnet werden. Ein T-Shirt im Stillstand mit 90 % Wahrscheinlichkeit zu falten ist leicht, aber 99 % Erfolgsquote oder schnelles Falten ist unglaublich komplex
Man sollte nicht erwarten, dass sie inverse Kinematik wie digitale Puppen einfach direkt nachahmen. Wenn das Optimierungsziel ein geringerer Energieverbrauch ist, können die Bewegungen eines mehrgelenkigen elektrischen Arms etwas seltsam aussehen
Bei humanoiden Robotern habe ich wegen der Grenzen der Aktuatoren die Erwartungen aufgegeben. Seit Honda ASIMO gab es kaum Innovation, und ich glaube nicht, dass jemand einen 80 kg schweren, schwankenden Metallklotz zu Hause oder am Arbeitsplatz haben will
Die finale Roboterrevolution könnte auch auf genetisch veränderte Menschen- oder Tierkörper setzen, bei denen das Gehirn ersetzt wurde. Ein Bär, der so verändert wurde, dass er kein Bewusstsein hat, und per Neuralink und LLM gesteuert wird, wäre meiner Ansicht nach besser als Bauarbeiter geeignet; schnelle Tiere für Lieferungen, Giraffen für Lagerhäuser
Angesichts interessanter Arbeiten im 3D-Druck dachte ich, dass auch Aktuatoren große Fortschritte machen; deshalb würde ich gern mehr darüber wissen, warum sie zurückliegen sollen
Man sollte einfach eine große Box bauen, die wie eine Spülmaschine Eingaben verarbeitet und Ergebnisse liefert. Statt menschliche Hände nachzuahmen, wäre es viel effizienter, ein Gerät zum Falten von Kleidung als Pendant zu Waschmaschine und Trockner oder eine integrierte Roboterküche zu bauen
Es braucht jemanden, der das tatsächliche Niveau dieser Technologie ehrlich einschätzen kann. Interessant wären die nötige Messtechnik, die Qualität der Interaktion und die Leistung bei unstrukturierten Alltagsaufgaben wie Türklinken drehen, Stürze abfangen bzw. sich davon erholen und Kollisionen vermeiden.
Verlässliche Daten zur Genauigkeit fehlen ebenfalls, Benchmarks wie LIBERO sind mit fast durchgehend 95 % praktisch gesättigt, und jedes Unternehmen bzw. jede Forschungsgruppe nutzt eigene Bewertungen. Viele Firmen fälschen Demos oder lassen Roboter gefährlich nahe an Menschen arbeiten.
Schwieriger als Türklinken oder Sturz-Recovery ist in der Fertigung, Ziegel oder Bauteile exakt auszurichten. Statt komplexer Humanoiden mit vielen zu verwaltenden Gelenken scheinen Roboterarme auf Rädern wie Mobile ALOHA besser geeignet, etwa zum Aufräumen von Hotelzimmern oder für standardisierte Kochaufgaben in Restaurants.
Wie in https://rodneybrooks.com/why-todays-humanoids-wont-learn-dex... argumentiert wird, ist Geschicklichkeit auch ein Hardwareproblem, und ein Greifer ist keine Hand. Selbst die Manipulation mit mehrfingrigen Händen ist weiterhin schwierig, und auch die Sensorik reicht nicht aus.
Robotik ist, abgesehen vom Bereich der Cobots, eine Nischenindustrie; die Ausnahme sind Drohnen, die großes Potenzial haben, sobald nur das Problem der Flugzeit gelöst ist. Humanoide sind noch weit davon entfernt, in realen Umgebungen nützlich zu sein, und die meisten unbemannten Bodenfahrzeuge können auf Treppen nicht einmal rückwärtsfahren.
AI Robotics ist die eigentliche Revolution. Heute brauchen Kapitalbesitzer menschliche Arbeit, um mehr Kapital zu gewinnen; sobald die Inferenzkosten von Robotern niedriger sind als Arbeitskosten, wird menschliche Arbeit nicht mehr benötigt. KI wirkt sich zwar auch auf nicht-körperliche Arbeit aus, aber ein erheblicher Teil der Weltbevölkerung leistet körperliche Arbeit.
Als 47-jähriger Mann ohne Kinder hoffe ich darauf, im Alter möglicherweise Unterstützung durch Pflegeroboter zu bekommen.
Viele Hausarbeiten lassen sich ohne Humanoide automatisieren. Roomba reinigt den Boden, und man könnte in Häuser automatische Systeme für Müllentsorgung sowie Annahme, Sortierung und Lagerung von Lebensmitteln einbauen.
Humanoide sind unheimlich und schwer zu vertrauen. Ich frage mich, ob man ruhig schlafen könnte, wenn so ein Roboter im Haus ist, selbst in Situationen, in denen man den politischen Ansichten seines Herstellers widerspricht.
Ich frage mich, warum man auf einer endlichen Erde zusätzlich zu immer mehr Menschen auch noch Roboterkörper hinzufügen will. Rechenzentrums-KI konkurriert zumindest nicht physisch Schulter an Schulter mit mir; ich verstehe nicht, warum man trotz vorhandener Menschen hoch entwickelte Roboter haben möchte.
Wenn man für die Robotersteuerung ein komplettes LLM einsetzt, ist das zu schwergewichtig; selbst mit leistungsstarken GPUs dürfte die minimale Latenz bei 1–2 Sekunden liegen und für praktische Roboter ungeeignet sein.
Maschinelles Sehen sollte durch Machine Learning erledigt werden, die Bewegungssteuerung aber durch klassische PID-basierte lineare und nichtlineare Regelung; wenn man ein komplettes LLM als Controller verwendet, stößt man wohl an Hardwaregrenzen.
Unternehmen wie Physical Intelligence erzielen auch mit hierarchischen Architekturen, die schnelle und langsame Ebenen kombinieren, gute Ergebnisse, um Intelligenz und Latenz gemeinsam anzugehen.