Przejdź do treści
Biznes · Humanoidy · Prawo i bezpieczeństwo · Rynek

Gemini Robotics 2: Google DeepMind pokazuje jeden „mózg” dla różnych robotów

31.07.2026 · Redakcja RoboMorrow
Roboty sterowane przez Gemini Robotics 2 na różnych platformach sprzętowych

Google DeepMind zaprezentował Gemini Robotics 2 — nową rodzinę modeli AI przeznaczonych do sterowania robotami. Najważniejsza zmiana polega na rozszerzeniu sterowania z ramion i górnej części ciała na cały humanoid: od stóp po palce dłoni. Firma pokazuje również dłuższe planowanie zadań, współpracę kilku robotów oraz model działający lokalnie, bez stałego połączenia z chmurą.

Najważniejsze informacje

  • Gemini Robotics 2 ma sterować różnymi konstrukcjami: od robotów stołowych i ramion po pełne humanoidy,
  • na humanoidzie Apptronik Apollo 2 model kontroluje chodzenie, schylanie, balansowanie, sięganie i manipulowanie przedmiotami,
  • Gemini Robotics ER 2 odpowiada za rozumienie otoczenia, rozmowę z człowiekiem i planowanie wieloetapowych zadań,
  • system potrafi koordynować kilka robotów wykonujących wspólne zadanie,
  • Gemini Robotics On-Device 2 może działać lokalnie i według Google dostosować się do nowej konstrukcji robota przy mniej niż 200 przykładach,
  • model planujący ER 2 jest dostępny w publicznym podglądzie, ale modele bezpośrednio sterujące ruchem nadal pozostają w programach wczesnego dostępu,
  • Google nie wprowadził własnego robota do sprzedaży — rozwija warstwę inteligencji dla sprzętu partnerów.

Trzy modele zamiast jednego produktu

Nazwa Gemini Robotics 2 obejmuje trzy powiązane elementy. Pierwszy to model typu VLA, czyli vision-language-action. Otrzymuje obraz, instrukcję i dane z robota, a następnie generuje komendy ruchowe. To właśnie on odpowiada za bezpośrednią kontrolę ramion, dłoni, chwytaków, nóg i równowagi.

Drugi element, Gemini Robotics ER 2, działa jak nadrzędny „mózg”. Analizuje sytuację, rozkłada polecenie na etapy, śledzi wykonanie zadania i decyduje, co powinno nastąpić dalej. Nie steruje każdym silnikiem bezpośrednio, lecz przekazuje zadania niższej warstwie ruchowej.

Trzeci model, Gemini Robotics On-Device 2, został zoptymalizowany do pracy bezpośrednio na sprzęcie robota. Ma ograniczać opóźnienia, pozwalać na działanie bez internetu i ułatwiać wdrażanie systemu na nowych konstrukcjach.

Całe ciało humanoida pod kontrolą jednego modelu

W poprzednich wersjach Gemini Robotics demonstracje koncentrowały się głównie na manipulacji przy stole. Teraz Google DeepMind pokazuje Apptronik Apollo 2 wykonującego zadania wymagające jednoczesnego użycia nóg, tułowia i rąk. Robot może podejść do przedmiotu, schylić się, utrzymać równowagę, przenieść go i odłożyć na wskazane miejsce.

W jednej z demonstracji Apollo 2 otrzymuje polecenie umieszczenia konewki w zielonym pojemniku na dolnej półce. Robot musi zlokalizować przedmiot, podejść do niego, chwycić go, przemieścić się do regału, obniżyć pozycję ciała i wykonać odkładanie.

Google opublikował również wyniki dla ogólnej manipulacji całym ciałem. W testach z Apollo i dłońmi Inspire średnia skuteczność wyniosła 68,4 proc. przy podnoszeniu przedmiotów ze stołu, 45,7 proc. z podłogi oraz 76,3 proc. z półki. To znaczący postęp, ale jednocześnie dowód, że system nie jest jeszcze niezawodny w każdym scenariuszu.

Efektowne dłonie, ale trudne zadania nadal sprawiają problem

Gemini Robotics 2 steruje także pięciopalczastą dłonią SharpaWave o 22 stopniach swobody. Demonstracje obejmują między innymi wiązanie worka, zamykanie torebki strunowej oraz wkręcanie i wykręcanie żarówki.

Najcenniejszą częścią publikacji nie są jednak filmy, lecz podane przez Google wyniki. Wykręcanie żarówki osiągnęło 92 proc. skuteczności, ale jej wkręcanie tylko 36 proc. Zawiązanie worka zakończyło się powodzeniem w 44 proc. prób, zamknięcie torebki strunowej w 40 proc., a użycie szufelki w 32 proc.

To dobrze pokazuje obecny stan robotyki. Model potrafi wykonywać zadania, które jeszcze niedawno były poza zasięgiem systemów ogólnego przeznaczenia, ale najbardziej precyzyjne czynności nadal są wyraźnie mniej niezawodne niż praca człowieka. Wyniki pochodzą z testów Google DeepMind i nie zostały jeszcze niezależnie potwierdzone w długotrwałych wdrożeniach.

Planowanie na kilka minut i współpraca robotów

Gemini Robotics ER 2 ma wykonywać dłuższe sekwencje obejmujące setki decyzji. System obserwuje otoczenie, ocenia postęp i może ponowić krok, jeżeli wcześniejsza próba się nie powiedzie. Rozpoznaje również moment rozpoczęcia i zakończenia poszczególnych etapów.

Nowością jest współpraca kilku robotów. Modele mają rozpoznawać możliwości poszczególnych konstrukcji i dzielić zadania. W praktyce jeden robot mógłby wykonywać precyzyjną manipulację, a drugi transportować elementy lub pracować w innym obszarze.

Taki model może być istotny dla fabryk i magazynów, ponieważ przyszła automatyzacja prawdopodobnie nie będzie oparta na jednym uniwersalnym humanoidzie. Bardziej realny jest zespół wyspecjalizowanych urządzeń korzystających ze wspólnego systemu planowania.

Model lokalny: mniej opóźnień i większa kontrola nad danymi

Gemini Robotics On-Device 2 ma działać bezpośrednio na urządzeniu. Jest to ważne w zastosowaniach, w których przerwa w dostępie do internetu nie może zatrzymać robota albo przesyłanie obrazu z kamer do chmury byłoby zbyt wolne lub problematyczne z punktu widzenia prywatności.

Google twierdzi, że model można dostosować do nowych robotów dwuramiennych w ciągu kilku godzin, zazwyczaj z wykorzystaniem mniej niż 200 przykładów. Firma pokazuje działanie na konstrukcjach różniących się kształtem, sensorami i liczbą stopni swobody.

Nie oznacza to jednak, że dowolny producent może dziś pobrać model i uruchomić go na swoim robocie. Wersja On-Device 2 jest dostępna tylko dla wybranych testerów, a bezpośredni model VLA wymaga zgłoszenia do programu wczesnego dostępu.

Co jest dostępne, a co pozostaje demonstracją

Gemini Robotics ER 2 jest już dostępny w Google AI Studio oraz przez Gemini API jako publiczny podgląd. Firmy mogą eksperymentować z jego zdolnością do analizy obrazu, wideo, dźwięku i planowania działań.

Najbardziej spektakularne elementy — pełne sterowanie humanoidem i lokalny model ruchowy — nie są jeszcze produktem ogólnie dostępnym. Google współpracuje z partnerami sprzętowymi, w tym Apptronik, Boston Dynamics i Agile Robots, a dostęp do modeli ruchowych pozostaje ograniczony.

Nie podano ceny, warunków licencji dla komercyjnych flot ani harmonogramu szerokiego udostępnienia. Nie wiadomo także, ile danych i pracy integracyjnej będzie potrzebne do uzyskania wysokiej skuteczności w konkretnym zakładzie.

Bezpieczeństwo: nowy benchmark i zatrzymanie przy człowieku

Google przedstawił benchmark ASIMOV-Agentic, który ma oceniać zdolność systemu do odrzucania niebezpiecznych poleceń, rozpoznawania sytuacji niemożliwych do bezpiecznego wykonania oraz proszenia człowieka o pomoc.

Gemini Robotics ER 2 ma lepiej wykrywać obecność człowieka i uruchamiać bezpieczne zatrzymanie robota. Firma raportuje wysokie wyniki we własnych testach przestrzegania ograniczeń oraz reakcji na człowieka znajdującego się w odległości jednego metra.

Model AI nie zastępuje jednak klasycznych zabezpieczeń: ograniczenia siły, kontroli prędkości, awaryjnego zatrzymania, bezpiecznego planowania ruchu i certyfikacji konkretnej maszyny. Bezpieczeństwo zależy od całego systemu, a nie wyłącznie od warstwy Gemini.

Dlaczego to ważne dla rynku robotów

Największą ambicją Google DeepMind nie jest sprzedaż jednego humanoida. Firma próbuje stworzyć warstwę inteligencji, którą będzie można przenosić między różnymi konstrukcjami. Jeżeli ten model się sprawdzi, producenci sprzętu nie będą musieli od podstaw budować całego systemu rozumienia języka, planowania i uczenia zachowań.

Może to przyspieszyć rozwój rynku podobnie jak wspólne systemy operacyjne przyspieszyły rozwój smartfonów. Na dziś jest to jednak kierunek, nie gotowy standard. Modele pozostają częściowo zamknięte, integracje wymagają partnerstwa, a podane wyniki nadal pokazują znaczną różnicę między udaną demonstracją a niezawodnością wymaganą w domu lub firmie.

Ocena RoboMorrow

Status: duża premiera technologiczna, ograniczona dostępność komercyjna. Gemini Robotics 2 jest ważnym krokiem, ponieważ łączy kontrolę całego ciała, precyzyjną manipulację, dłuższe planowanie i możliwość działania lokalnego. Najbardziej wartościowe jest to, że Google opublikował także wyniki pokazujące ograniczenia systemu.

Nie jest to jednak „gotowy mózg”, który dziś można zainstalować w dowolnym humanoidzie. Firmy zainteresowane wdrożeniem powinny obserwować dostępność programu partnerskiego, wymagania sprzętowe, licencjonowanie oraz niezależne wyniki z rzeczywistych fabryk i magazynów.

Zdjęcie wyróżniające pochodzi z oficjalnych materiałów Google DeepMind dotyczących Gemini Robotics 2.

Źródła

Google DeepMind: Gemini Robotics 2 brings whole body intelligence to robots
Google DeepMind: Gemini Robotics 2 — modele i możliwości
Google DeepMind: Gemini Robotics ER 2
Google DeepMind: Gemini Robotics On-Device 2 — model card