humanoidalne.pl

Embodied AI i modele VLA — ile autonomii naprawdę jest w humanoidach

W 2026 r. żaden robot humanoidalny nie jest autonomicznym pracownikiem: według śledztwa Reuters z sierpnia 2026 humanoidy w chińskim centrum treningowym wykonują proste zadania z ok. 20% prędkości człowieka, a wiele głośnych pokazów to teleoperacja lub choreografia. Modele VLA (NVIDIA GR00T N1, Figure Helix, π0) to realny postęp badawczy, ale w robotach sprzedawanych w Polsce za ok. 30 000–280 000 zł kupujący dostaje fabryczne choreografie, zdalne sterowanie i co najwyżej SDK do własnych eksperymentów — nie "AI pracownika".

Stylizowany, geometryczny robot humanoidalny stoi w świetle reflektora na scenie z granatową kurtyną, a przerywane linie łączą go z ukrytym za kulisami pulpitem teleoperacji z dwoma joystickami; w lewym górnym rogu abstrakcyjne ikony oka, sześciokąta i strzałki symbolizują tor widzenie–model–działanie (ilustracja AI).
Embodied AI i modele VLA — ilustracja AI, grafika humanoidalne.pl, zrzeczenie się praw CC0 1.0 · grafika AI, nie jest zdjęciem produktu

Czym jest embodied AI i czym są modele VLA

Embodied AI (ucieleśniona sztuczna inteligencja) to systemy, które postrzegają świat fizyczny, podejmują decyzje i wykonują ruch — w odróżnieniu od chatbotów operujących wyłącznie na tekście. Dominującym podejściem są dziś modele VLA (vision-language-action): sieć neuronowa dostaje obraz z kamer robota i polecenie w języku naturalnym, a na wyjściu generuje ciągłe komendy dla przegubów. Śledztwo Reuters z sierpnia 2026 podkreśla, że modele VLA są znacznie trudniejsze w treningu niż LLM-y, bo wymagają tysięcy godzin danych z interakcji ze światem fizycznym — i znajdują się na wcześniejszym etapie rozwoju.

Trzy najgłośniejsze modele VLA wyznaczają stan techniki. NVIDIA GR00T N1 (marzec 2025) to — według NVIDIA — pierwszy otwarty model fundamentowy dla humanoidów: System 2 (moduł wizyjno-językowy) interpretuje scenę i polecenie, a System 1 (transformer dyfuzyjny) generuje płynne akcje; model trenowano na mieszance trajektorii prawdziwych robotów, nagrań ludzi i danych syntetycznych, a zademonstrowano m.in. na humanoidzie Fourier GR-1. Figure Helix steruje całą górną połową ciała robota (35 stopni swobody): System 2 to VLM o 7 mld parametrów pracujący z częstotliwością 7–9 Hz, System 1 to szybka polityka wizyjno-ruchowa 80 mln parametrów działająca w pętli 200 Hz. π0 od Physical Intelligence łączy 3-miliardowy VLM z ekspertem akcji opartym na flow matching i generuje komendy z częstotliwością do 50 Hz; wagi opublikowano otwarcie w repozytorium openpi, a checkpointy bazowe trenowano na ponad 10 000 godzin danych robotów.

ModelTwórcaArchitektura i częstotliwośćStatus (2026)
GR00T N1 (obecnie N1.7)NVIDIAdwusystemowy: VLM (System 2) + transformer dyfuzyjny (System 1)otwarty model fundamentowy, do pobrania i fine-tuningu
HelixFigure AISystem 2: VLM 7B, 7–9 Hz; System 1: polityka 80M, 200 Hzzamknięty; wyłącznie roboty Figure — niedostępne w sprzedaży w Polsce
π0 / π0.5Physical IntelligenceVLM 3B + ekspert akcji (flow matching), do 50 Hzotwarte wagi (openpi); demonstracje laboratoryjne, m.in. składanie prania

RL i sim2real: dlaczego humanoidy świetnie tańczą, ale nie pracują

Chód, bieg, taniec i kung-fu to efekt uczenia ze wzmocnieniem (RL) w symulacji. Frameworki takie jak NVIDIA Isaac Lab czy MuJoCo pozwalają trenować tysiące wirtualnych kopii robota równolegle, a randomizacja domeny (losowe tarcie, masy, opóźnienia sygnału) umożliwia przeniesienie wytrenowanej polityki na fizyczny sprzęt — to tzw. sim2real. Ta część technologii jest dojrzała i faktycznie działa autonomicznie, dlatego pokazy zwinności wychodzą tak efektownie.

Problem w tym, że lokomocja to nie inteligencja. Alan Fern, profesor robotyki z Oregon State University, skomentował dla Reuters pekiński półmaraton robotów wprost: oprogramowanie umożliwiające humanoidom bieganie zademonstrowano ponad pięć lat wcześniej, a pokazy zwinności niewiele mówią o zdolności do użytecznej pracy. Chodzenie po scenie nie wymaga rozumienia sceny. W sprzedawanych w Polsce wariantach EDU (Unitree SDK2, ROS 2, NVIDIA Isaac Sim) kupujący może trenować własne polityki RL — to realna wartość dla uczelni i zespołów R&D, ale wymaga własnej pracy inżynierskiej; szczegóły w przewodniku ROS i SDK w humanoidach.

Teleoperacja i choreografia: człowiek za kulisami pokazu

Teleoperacja oznacza, że operator w goglach widzi obraz z kamer robota i steruje jego rękami przez kontrolery z czujnikami ruchu. Najgłośniejszy przykład: roboty Tesla Optimus na evencie "We, Robot" (październik 2024) rozmawiały z gośćmi i serwowały drinki, ale — jak ujawniły Bloomberg i The Verge — wiele interakcji nadzorowali zdalnie pracownicy Tesli; robot-barman sam przyznał gościom, że wspomaga go człowiek, a analityk Morgan Stanley napisał w nocie, że pokazy opierały się na teleoperacji. Programu Optimus i tak nie da się kupić w Polsce.

Podobnie 1X NEO, reklamowany jako pierwszy konsumencki humanoid domowy (premiera październik 2025, cena 20 000 USD): zadania, których robot nie zna, wykonuje za niego zdalny operator 1X, patrząc przez kamery robota na wnętrze domu klienta. W Polsce NEO nie jest oficjalnie sprzedawany. Teleoperacja ma też drugą, uczciwszą rolę: dostarcza dane do treningu modeli VLA. Reuters opisał centrum treningowe w Liuzhou (sprzęt UBTech z przetargu wartego 18 mln USD), gdzie kilkunastu trenerów w goglach uczy ponad 100 humanoidów pakowania makaronu i parzenia kawy — początkujący trener uzyskuje jeden użyteczny ruch na około 300 prób, doświadczony jeden na 50. Sama teleoperacja nie jest oszustwem; problemem jest sugerowanie widzom, że robot działa samodzielnie. Cytowany przez Reuters szef startupu robotycznego ujął to dosadnie: duża część tego, co widzimy, to taniec udający pracę.

Twarde liczby 2025–2026: fabryki, przetargi, zawody

Śledztwo Reuters (sierpień 2026) daje najtwardsze dostępne dane. Humanoidy w centrum treningowym wykonują proste zadania z około 20% prędkości lub wydajności człowieka. Ponad 150 chińskich firm rozwija humanoidy (dane NDRC) — więcej niż istnieje chińskich marek aut elektrycznych. Chińskie zakupy państwowe humanoidów i powiązanego sprzętu sięgnęły co najmniej 230 mln USD w pierwszej połowie 2026 r. (rok wcześniej 62 mln USD, w I poł. 2024 r. 6 mln USD) — popyt jest w dużej mierze publiczny, nie komercyjny. Morgan Stanley prognozuje spadek średniej ceny humanoida o 15% w 2026 r. W fabryce Zeekr (Geely), gdzie testowano humanoidy UBTech przy sortowaniu i przenoszeniu komponentów, wszystkie kluczowe zadania na czynnej linii nadal wykonują ramiona przemysłowe i pojazdy automatyczne.

Zawody potwierdzają ten obraz. W półmaratonie E-Town w Pekinie (kwiecień 2025) wystartowało 21 robotów, a trasę ukończyło tylko 6; zwycięzca Tiangong Ultra potrzebował 2 h 40 min i trzech wymian baterii, podczas gdy najszybszy człowiek przebiegł dystans w 1 h 2 min. Roboty biegły w asyście ludzkich opiekunów, a część przewróciła się już na starcie. Więcej o tym, co działa poza salą demonstracyjną: wdrożenia robotów humanoidalnych.

Co naprawdę dostaje kupujący w Polsce

Wersje podstawowe humanoidów dostępnych od ręki — Unitree R1 (od 45 000 zł) i Unitree G1 (od 94 050 zł) — w ogóle nie wspierają programowania: producent zaznacza wprost brak "secondary development". Kupujący dostaje aplikację mobilną, pilota i zestaw fabrycznych zachowań: chód, taniec, machanie, podążanie za operatorem. To platformy pokazowe na eventy i do podstawowej edukacji, nie pracownicy.

Warianty badawcze dodają narzędzia, nie autonomię: Unitree R1 EDU od 73 500 zł i Unitree G1 EDU za ok. 150 000–280 000 zł oferują Unitree SDK2, ROS 2 i wsparcie Isaac Sim, a wyższe konfiguracje także moduł NVIDIA Jetson Orin; Booster K1 (od 29 900 zł netto) daje Pythona, ROS/ROS 2 i głosowy LLM (Doubao, bezpłatnie przez 6 miesięcy). SDK to zestaw do samodzielnej budowy autonomii — żaden robot sprzedawany w Polsce nie ma fabrycznie działającego modelu VLA, który wykonywałby prace użytkowe.

Praktyczny test przed zakupem: poproś sprzedawcę o pokaz zadania użytkowego bez operatora i o nagranie bez cięć. Koszty całkowite policzysz w kalkulatorze TCO, a rachunek opłacalności w analizie czy robot humanoidalny się opłaca.

Stan techniki 2026: co jest realne, a co marketingiem

Realne są trzy rzeczy: autonomiczna lokomocja (polityki RL działają na pokładzie robota bez operatora), otwarte modele VLA obniżające próg wejścia dla badaczy (GR00T N1, openpi) oraz laboratoryjne demonstracje manipulacji — π0 składa pranie w nieciętym, autonomicznym nagraniu. Marketingiem pozostają: "AI pracownik", obietnice autonomii domowej i pokazy bez ujawnienia teleoperacji. Prognozę pracownika centrum w Liuzhou, że roboty dogonią ludzi w 2–3 lata, traktujemy jako nadzieję branży, nie zobowiązanie — cytowany przez Reuters inwestor uważa konsolidację za pewną („prędzej czy później”), a wielu founderów i inwestorów spodziewa się jej początku na przełomie 2026 i 2027 r.

Dane ze źródłami

Każdy atrybut ma podane źródło i status wiarygodności. Jak weryfikujemy dane →

Atrybut Wartość Wiarygodność Źródło
prędkość humanoidów w prostych zadaniach (centrum treningowe Liuzhou) ok. 20% prędkości/wydajności człowieka Zweryfikowane reuters.com
skuteczność treningu przez teleoperację nowicjusz: 1 użyteczny ruch na ok. 300 prób; doświadczony trener: 1 na 50 Zweryfikowane reuters.com
Figure Helix — częstotliwość sterowania System 1: 200 Hz (polityka 80 mln parametrów, 35 DoF); System 2: VLM 7 mld parametrów, 7–9 Hz Zweryfikowane figure.ai
π0 — częstotliwość akcji i dane treningowe komendy do 50 Hz (flow matching); otwarte checkpointy trenowane na 10 000+ h danych robotów Zweryfikowane pi.website
GR00T N1 — architektura otwarty model VLA o architekturze dwusystemowej (VLM + transformer dyfuzyjny), publikacja marzec 2025 Zweryfikowane arxiv.org
półmaraton humanoidów w Pekinie (kwiecień 2025) ukończyło 6 z 21 robotów; zwycięzca Tiangong Ultra: 2 h 40 min i 3 wymiany baterii (najlepszy człowiek: 1 h 2 min) Zweryfikowane irunfar.com
liczba firm rozwijających humanoidy w Chinach ponad 150 (dane NDRC, sierpień 2026) Zweryfikowane reuters.com
chińskie zakupy państwowe humanoidów co najmniej 230 mln USD w I poł. 2026 r. (62 mln USD rok wcześniej; 6 mln USD w I poł. 2024 r.) Zweryfikowane reuters.com
Tesla Optimus na evencie "We, Robot" (październik 2024) interakcje nadzorowane zdalnie przez ludzi; robot-barman przyznał, że jest "wspomagany przez człowieka" Zweryfikowane techcrunch.com
1X NEO — cena i model działania 20 000 USD; zadania nieznane robotowi wykonuje zdalny operator 1X Zweryfikowane 1x.tech

Wyjątki i niuanse

  • Lokomocja jest naprawdę autonomiczna: chód, bieg i układy taneczne to polityki RL działające na pokładzie robota bez operatora. Teleoperacja dotyczy przede wszystkim manipulacji i interakcji z ludźmi — nie każdy pokaz jest sterowany ręcznie, ale choreografia nie dowodzi ogólnej inteligencji.
  • Postęp modeli VLA jest realny, nie pozorowany: π0 składa pranie w nieciętym autonomicznym nagraniu, a Helix steruje 35 stopniami swobody górnej połowy ciała. To jednak systemy laboratoryjne i pilotażowe — nie funkcje robotów sprzedawanych w Polsce.
  • Liczba "20% prędkości człowieka" pochodzi od jednego pracownika jednego centrum treningowego, nie z systematycznego benchmarku; firma Galbot argumentuje z kolei, że praca ciągła robota może częściowo rekompensować niższe tempo. Traktuj obie strony jako deklaracje zainteresowanych.
  • Teleoperacja bywa uczciwym narzędziem: służy do zbierania danych treningowych dla modeli VLA i jest jawnym modelem działania 1X NEO. Problemem etycznym jest dopiero pokaz, który ukrywa udział człowieka przed widzem lub inwestorem.

Najczęstsze pytania

Co to jest embodied AI?

To sztuczna inteligencja ucieleśniona w fizycznej maszynie, która postrzega otoczenie, podejmuje decyzje i działa — w robotyce humanoidalnej realizowana głównie przez modele VLA (vision-language-action). Według Reuters modele te wymagają tysięcy godzin danych ze świata fizycznego i są na wcześniejszym etapie rozwoju niż modele językowe.

Czy roboty humanoidalne są autonomiczne?

Częściowo: lokomocja (chód, bieg, taniec) działa autonomicznie dzięki politykom RL, ale użyteczna praca — nie. Według śledztwa Reuters z sierpnia 2026 humanoidy wykonują proste zadania z ok. 20% prędkości człowieka, a wiele pokazów manipulacji to teleoperacja lub choreografia.

Co to jest model VLA (vision-language-action)?

Sieć neuronowa, która z obrazu kamer i polecenia w języku naturalnym generuje komendy ruchu dla robota. Przykłady: NVIDIA GR00T N1 (otwarty, architektura dwusystemowa), Figure Helix (sterowanie 200 Hz, VLM 7–9 Hz) i π0 Physical Intelligence (flow matching, do 50 Hz, otwarte wagi w openpi).

Skąd wiadomo, że pokazy robotów bywają teleoperowane?

Z doniesień medialnych i przyznań samych firm: na evencie Tesli "We, Robot" (2024) Bloomberg i The Verge ujawniły zdalne sterowanie Optimusami, a robot-barman przyznał, że wspomaga go człowiek. 1X otwarcie deklaruje, że nieznane zadania NEO wykonuje zdalny operator. Reuters opisał też centra treningowe, gdzie ludzie w goglach sterują robotami, by zbierać dane.

Czy robot humanoidalny kupiony w Polsce będzie sam pracował?

Nie. Wersje podstawowe (Unitree R1 od 45 000 zł, G1 od 94 050 zł) oferują tylko fabryczne choreografie i sterowanie z aplikacji, bez możliwości programowania. Warianty EDU (od 73 500 zł) dodają SDK, ROS 2 i wsparcie symulatorów — czyli narzędzia do samodzielnej budowy autonomii, nie gotowego "AI pracownika".

Kiedy humanoidy osiągną pełną autonomię?

Nie ma zweryfikowanej daty. Pracownik chińskiego centrum treningowego cytowany przez Reuters szacuje, że roboty mogą dogonić tempo ludzi w 2–3 lata, ale to prognoza strony zainteresowanej; cytowany w tym samym śledztwie inwestor uważa konsolidację przegrzanej branży za pewną („prędzej czy później”), a wielu founderów i inwestorów spodziewa się jej początku na przełomie 2026 i 2027 r. Deklaracje producentów o datach traktuj jako marketing.

Dane zweryfikowane u źródeł: 31.08.2026.

Roboty powiązane z tym tematem