Za posledních osmnáct měsíců získaly firmy vyvíjející humanoidní roboty miliardy dolarů. Značná část těchto peněz ovšem podle Nikity Rudina, spoluzakladatele a generálního ředitele společnosti Flexion, potichu financuje něco jiného, než by se čekalo – najímání lidí, kteří roboty dálkově ovládají. Odvětví tak podle něj řeší datový problém, o němž mluví, jako by šlo o odpověď na nedostatek pracovní síly.
Teleoperace a lidské demonstrace ve velkém měřítku se staly převládající metodou trénování systémů fyzické umělé inteligence. Přitahují velký kapitál, vytvářejí pracovní místa v zemích s nižšími mzdami a v médiích jsou vykládány jako důkaz pokroku. Pod tím vším leží předpoklad, že dostatečné množství ukázek nakonec vytvoří roboty schopné zobecňovat napříč reálným prostředím. Právě tento předpoklad si podle Rudina zaslouží mnohem přísnější prověření, než se mu dostává.
Teleoperace naráží na strukturální strop
Jazykové modely mohou čerpat z desetiletí psaného textu, článků a knih. U robotů žádný takový archiv neexistuje – každou jednotlivou demonstraci musí někdo vytvořit, a objem dat proto roste jen tak rychle, jak to dovolí lidská práce.
Rudin uvádí, že teleoperační datové sady jsou přibližně 100 000krát menší než data používaná k trénování dnešních jazykových a vizuálních modelů. Tuto propast podle něj nezavře najímání dalších operátorů, protože reálný svět se nepřestává měnit: regál se posune, klika u dveří vypadá trochu jinak, na linku dorazí nový typ obalu. Každá odchylka vyžaduje novou ukázku, takže problém roste rychleji než pracovní síla.
Druhým úskalím je kvalita dat. Operátoři nevnímají hmat a nedokážou spolehlivě odhadnout vzdálenost, takže se pohybují pomalu a své pohyby přehnaně korigují. Robot se pak učí ze záznamů člověka, který zápasí s ovladačem – a přesně to si osvojí.
Lidská cena sběru dat
Odpovědí odvětví na nedostatek dat bylo najmout více lidí. Pracovníci, převážně v ekonomikách s nižšími mzdami, natáčejí domácí činnosti, ovládají roboty na dálku nebo se pohybují v provozech s kamerovými postroji na těle. Kolem toho vznikl celý komerční ekosystém: startupy v Číně, Indii, Evropě i USA prodávají teleoperační data podobně, jako se kdysi prodávaly anotované texty pro jazykové modely.
Původní argument pro humanoidní roboty přitom zněl, že kvůli demografickým změnám, stárnutí populace a nedostatku pracovníků nebude mít tato místa kdo obsadit. Pokud ale ve skutečnosti stavíme infrastrukturu, která ke svému fungování potřebuje trvalý přísun lidských demonstrací, mohli bychom stejně dobře nechat tytéž lidi vykonávat práci přímo. Systém, který si bez čerstvého lidského vstupu neporadí s ničím novým, je v podstatě jen dalším způsobem organizace lidské práce.
Obvyklá obhajoba zní, že teleoperace je most – způsob, jak začít, než dozrají lepší metody trénování. U úzce vymezených, opakovaných úkonů v kontrolovaném prostředí to podle Rudina platí. Velká část oboru ale buduje infrastrukturu na generování demonstrací donekonečna, aniž by kdokoli srozumitelně vysvětlil, kdy a jak se to změní. Sleduje se to, co se snadno počítá: nasbírané ukázky, hodiny záznamu, splněné úkoly v připravených podmínkách. Nic z toho ale neříká, zda si robot poradí s něčím, co nikdy neviděl, na místě, které pro něj nikdo nepřipravil.
Cesta, která odpovídá povaze problému
Když výzkumníci trénovali rané jazykové modely na obrovských objemech textu, dostali systémy, jež dokázaly volně napodobit Shakespearův styl, ale skládaly slova, která nedávala smysl. Průlom přišel až s posilovaným učením v syntetických prostředích – teprve pak vznikly systémy schopné uvažovat, programovat a plnit složité instrukce.
Robotika podle Rudina uvízla v této rané fázi. Škálování teleoperačních dat odpovídá škálování předtrénování na stotisíckrát menším objemu textu. Výsledkem jsou roboti, kteří jakžtakž pohnou pažemi, něco občas uchopí a občas ne. Umějí mlhavě napodobit, co jim operátor předvedl, ale nedokážou se zorientovat v situaci, kterou neznají.
Mezi klasickou teleoperací a plnou autonomií existují mezistupně – snímání videa z pohledu první osoby nebo zařízení typu Universal Manipulation Interface (UMI), kde operátor předvádí úkon s ručním chapadlem místo dálkového ovládání robota. Tyto metody snižují zátěž operátorů a přinášejí přirozenější data o pohybu, stále však vyžadují člověka ve smyčce. Pro úzce definované úlohy mohou být užitečným odrazovým můstkem, závislost odvětví na lidech ale neodstraňují.
Změnu podle Rudina přináší posilované učení. Systém trénovaný pomocí RL nenapodobuje operátora, ale hledá řešení metodou pokusu a omylu – zkusí úkol, selže, upraví postup a zkusí to znovu, a to v milionech iterací bez účasti člověka. Ze samotné povahy věci pak vyplývá simulace: miliony iterací v reálném světě by zničily hardware a zabraly roky. V simulaci lze prostředí okamžitě resetovat, spouštět paralelně a generovat variabilitu v měřítku, jakému by žádný lidský tým nestačil. Na rozdíl od teleoperace navíc škáluje přímo s výpočetním výkonem: více GPU znamená více prostředí, více variant a rychlejší iterace.
Lidé, kteří teleoperační práci vykonávají, mají podle Rudina právo vědět, zda je skutečným cílem autonomie – a stejné právo mají i ti, kdo tyto projekty financují. Pokud firma nedokáže daty doložit, že závislost na lidech v čase klesá, přestává být teleoperace dočasným řešením a stává se metodou trvalou.
Nikita Rudin dokončil doktorát v Robotic Systems Lab na ETH Zurich a souběžně pracoval ve společnosti NVIDIA, kde se podílel na nástrojích Isaac Gym a Isaac Lab. Flexion, kterou dnes vede, nedávno získala 50 milionů dolarů od DST/NVentures na vývoj univerzálního „mozku“ pro humanoidní roboty.
Zdroj: therobotreport.com


