Przejdź do treści
Aktualności · Biznes · Humanoidy · Physical AI

Maniformer przekracza 1 mln godzin danych Physical AI i 20 tys. MEgo

01.09.2026 · Redakcja RoboMorrow
Systemy Maniformer MEgo do zbierania danych Physical AI wraz z podziałem miliona godzin danych na Ego View, Ego + Wrist i UMI Gripper
Zweryfikowano: 1 września 2026, 20:30 CEST. Maniformer ogłosił dwa powiązane kamienie milowe swojej infrastruktury Physical AI: ponad 1 mln godzin danych z realnego świata oraz dostarczenie 20 000. urządzenia z rodziny MEgo. Dane o jakości rekonstrukcji i przewadze HandPose pozostają wynikami wewnętrznymi firmy, nie niezależnym benchmarkiem RoboMorrow.

Wyścig Physical AI coraz mniej przypomina konkurs na to, kto zbuduje najbardziej efektownego humanoida. Coraz ważniejsze staje się pytanie, kto potrafi dostarczyć modelom ogromną ilość danych o prawdziwych ludzkich działaniach: chwytaniu, przesuwaniu, otwieraniu, sortowaniu, pracy przy stole, w sklepie, magazynie czy fabryce. Maniformer próbuje zbudować właśnie taką warstwę infrastruktury. 31 sierpnia firma poinformowała, że przekroczyła 1 mln godzin danych z realnego świata i dostarczyła 20 000. urządzenie MEgo do ich zbierania.

To ważne także dlatego, że Maniformer nie opiera całego procesu na klasycznej teleoperacji robota. Urządzenia MEgo mają rejestrować naturalne zachowania człowieka bez konieczności obecności robota w danym miejscu. Firma chce w ten sposób produkować dane szybciej, taniej i w większej liczbie środowisk, a dopiero później przekształcać je w informacje użyteczne dla modeli VLA, systemów embodied AI i polityk sterowania.

Milion godzin: co dokładnie obejmuje zbiór

Według komunikatu Maniformer zgromadzony materiał obejmuje 22 główne kategorie scen, ponad 10 000 realnych środowisk, ponad 50 000 kategorii obiektów i ponad 500 szczegółowych zadań. Firma wymienia osiem głównych obszarów zastosowań: dom, biuro, retail, produkcję, magazyny, gastronomię, rozrywkę i transport.

Nie jest to jedynie zwykłe wideo. Zbiór ma łączyć RGB, depth, IMU, dotyk, audio i trajektorie ruchu. Maniformer dzieli dane na trzy główne konfiguracje. Około 500 tys. godzin pochodzi z Ego View, czyli pierwszoosobowego zapisu interakcji gołymi dłońmi; około 350 tys. godzin z Ego + Wrist, gdzie dodatkowe sensory śledzą pozycję nadgarstka i ruch; a około 150 tys. godzin z UMI Gripper, który rejestruje trajektorie końcówki roboczej i chwytaka.

Ten podział jest ciekawy, bo pokazuje próbę rozwiązania jednego z najdroższych problemów robotyki: robot nie musi być fizycznie obecny przy każdej demonstracji. Jeżeli ruch człowieka można wiarygodnie odtworzyć w przestrzeni i później przenieść na różne embodimenty, koszt zebrania dużego datasetu może spaść. To nadal hipoteza wymagająca twardych wyników w zamkniętej pętli na robotach, ale skala infrastruktury jest już znacznie większa niż typowy projekt laboratoryjny.

20 000. MEgo trafiło do JD; Tencent Robotics X też wchodzi do układanki

Niezależne chińskie relacje z wydarzenia podają, że jubileuszowe, 20 000. urządzenie MEgo zostało przekazane JD i ma wejść do realnych operacji biznesowych. Te same relacje informują o współpracy Maniformer z Tencent Robotics X przy dostarczaniu danych na potrzeby modeli embodied AI. To istotniejsze niż sama liczba wyprodukowanych urządzeń, bo pojawia się pierwszy publiczny sygnał wykorzystania systemu przez dużych odbiorców technologicznych.

Nie znamy jednak struktury tych 20 tys. urządzeń: ile zostało sprzedanych klientom, ile pracuje we własnej sieci Maniformer, ile jest aktywnych jednocześnie i jaka część generowanych danych faktycznie kończy jako płatny dataset. Sama liczba hardware’u nie mówi również, jaki jest koszt jednej użytecznej godziny danych po filtracji, anotacji i ocenie jakości.

MEgo Engine, HandPose i problem jakości danych

Zbieranie miliona godzin materiału nie ma dużej wartości, jeżeli ruchów nie da się precyzyjnie odtworzyć. Dlatego Maniformer rozwija MEgo Engine do przetwarzania, percepcji, anotacji i oceny jakości oraz technologię HandPose do rekonstrukcji dłoni. Firma twierdzi, że w wewnętrznych testach HandPose obniżył błąd PA-MPJPE o 62% względem kolejnego rozwiązania i zmniejszył jitter między klatkami o 93%. Stos MPR ma z kolei odtwarzać trajektorie głowy, dłoni i chwytaków z błędem poniżej 1 cm.

To są deklaracje Maniformer. RoboMorrow nie traktuje ich jako niezależnie potwierdzonych benchmarków. Nie znamy pełnej konfiguracji testu, konkurencyjnych baseline’ów ani wyników reprodukcji przez zewnętrzne zespoły. Najważniejszym testem będzie nie dokładność rekonstrukcji sama w sobie, lecz to, czy dane z MEgo skracają czas uczenia konkretnego robota, zwiększają success rate i zmniejszają liczbę interwencji przy nowych zadaniach.

Dlaczego ten temat łączy się z Figure Index i Isaac 0.5

Maniformer nie pojawia się w próżni. Kilka dni wcześniej Figure pokazało Index, system crowdsourcingu danych fizycznych, a Perceptron opublikował Isaac 0.5, model próbujący łączyć doświadczenie robotów z ogromną ilością zwykłego wideo. Wszystkie trzy historie prowadzą do podobnego wniosku: przewaga w robotyce może coraz częściej powstawać w pętli data engine → model → deployment → nowe dane, a nie wyłącznie w mechanice robota.

Co to znaczy dla Polski i UE

Dla Europy temat ma dodatkową warstwę regulacyjną. Zbieranie pierwszoosobowego wideo, audio, ruchu dłoni i danych z realnych miejsc pracy może obejmować informacje o osobach postronnych, wnętrzach firm i procesach produkcyjnych. Przy europejskich wdrożeniach znaczenie będą miały zgody, anonimizacja, retencja, transfer danych, cyberbezpieczeństwo i możliwość audytu pochodzenia datasetów.

Dla polskich integratorów i producentów robotów najważniejsze pytanie brzmi jednak praktycznie: czy zamiast budować własne laboratorium teleoperacyjne będzie można kupić dane odpowiadające konkretnemu zadaniu i skrócić czas wdrożenia. Jeżeli tak, firmy takie jak Maniformer mogą stać się dla Physical AI odpowiednikiem infrastruktury danych znanej z rozwoju dużych modeli językowych.

RoboMorrow: decyzja redakcyjna

PUBLIKOWAĆ jako HOT NEWS. Milion godzin oraz 20 tys. urządzeń to jeden wspólny, materialny etap skalowania infrastruktury danych. Nie należy tworzyć kolejnego newsa tylko dlatego, że pojawi się następne medium opisujące te same liczby. Następny osobny update powinien wymagać nowego dużego klienta, kolejnego rzędu wielkości danych, ujawnionej ekonomiki usługi albo niezależnego dowodu, że dane MEgo realnie poprawiają wyniki robotów.

Źródła

Maniformer / GlobeNewswire — komunikat źródłowy · Securities Times — 20 000. MEgo przekazane JD · Yangtzeer — kontekst JD i skali · Maniformer — strona firmy