eTEC.NEWS je komunitní web zaměřený na technologie, umělou inteligenci, roboty, solární energii, elektromobilitu, produkty a služby z těchto oblastí.

Robotika nezažije čistý moment ve stylu Llamy

Robotika nezažije čistý moment ve stylu Llamy

Na zkušebním stole nedávno malý čtyřnohý robot čistě zatočil doprava. Zrcadlově stejná zatáčka doleva se však zadrhla a robot ztratil kontakt s podložkou. Nohy totiž dopadly do odlišných oblastí servomotorů a zatížily tělo robotu jinak, takže stejný povel vyvolal dva různé výsledky. Kód byl symetrický, kontaktní mechanika nikoli.

Modely pro roboty se stávají snadno dostupnými

Analogie s jazykovým modelem Llama funguje jen do chvíle, než musí model pohnout fyzickým strojem. Původní článek o Llamě dal softwarovým týmům znovupoužitelný startovní bod – tým, který nezaplatil za samotný trénink, mohl model upravit, zmenšit a nasadit pomocí nástrojů, které už znal. Váhy modelu byly užitečné proto, že ostatní týmy už měly nástroje, jak je proměnit ve fungující software.

Modely pro roboty fungují podobně, ale robotická politika (policy) se nepohybuje sama od sebe. Lokální řídicí stack převádí výstup politiky na pohyb konkrétního instalovaného robota prostřednictvím jeho řadiče, v rámci bezpečnostního rámce dané buňky. Přístup k modelům rozšíří možnosti toho, co se roboti pokusí dělat. Skutečná výhoda však přijde až tehdy, když se toto chování promění v podporovanou práci na nasazených systémech, doplněnou záznamem poruch, který může technik použít i o měsíce později.

Projekt Open X-Embodiment od Google DeepMind shromáždil robotická data napříč institucemi a typy robotů a jeho výsledky RT-X ukázaly, že trénink napříč různými fyzickými ztělesněními zlepšuje v některých případech přenositelnost, místo aby každý systém musel učit pouze ze svého úzkého souboru dat.

Novější modely od DeepMind rozdělují práci napříč celým robotickým stackem. Gemini Robotics 1.5 je model typu vize-jazyk-akce, který přebírá vizuální informace a instrukce a převádí je na povely pro motory. Gemini Robotics-ER 1.6 stojí výše ve stacku a zajišťuje prostorové uvažování a plánování úkolů, včetně kontroly průběhu a volání nástrojů.

Společnost NVIDIA postupuje podobným směrem – díky vydáním modelů GR00T a Isaac, které se dostávají do vývojářských kanálů, jako je Hugging Face LeRobot. Z hlediska distribuce tak příběh Llamy odpovídá myšlence, že schopné robotické politiky se pro vývojáře stávají snáze dostupnými.

Vůči odhadu společnosti Crunchbase, podle něhož robotika v roce 2025 přilákala téměř 14 miliard dolarů rizikového kapitálu, se jednotlivá kola financování rychle sčítají. Skild AI získala 1,4 miliardy dolarů na omnibodied robotický model, zatímco Physical Intelligence údajně jedná o dalších 1 miliardě dolarů při ocenění nad 11 miliard. Společnost Advanced Machine Intelligence Yanna LeCuna získala 1,03 miliardy dolarů na odlišný přístup k modelování světa a Wayve uzavřela sérii D ve výši 1,2 miliardy dolarů pro autonomní řízení. Tato kola financování předpokládají, že robotická inteligence bude znovupoužitelná dříve, než odvětví prokáže, že distribuční cesta funguje napříč různými systémy.

OpenVLA je 7miliardový open-source model typu vize-jazyk-akce, natrénovaný na 970 000 epizodách manipulace robotů z Open X-Embodiment. Physical Intelligence řeší stranu akcí pomocí systému FAST, který převádí úseky robotických akcí na tokeny. Repozitář openpi ukazuje, co všechno zbývá udělat poté, co je model k dispozici – tým musí spustit inferenci, doladit ji na datech vlastního robota a poté výsledek ověřit na cílovém stroji. I tato cesta s sebou nese hardwarové náklady: repozitář uvádí požadavek více než 8 GB paměti GPU pro inferenci, 22,5 GB pro doladění metodou LoRA a 70 GB pro plné doladění.

Kde se přenositelnost láme

Robotická buňka může projít akceptačním testem a běžet hladce většinu cyklů. Skutečný problém spočívá ve zbývajících selháních, kdy malé fyzické změny vytvoří jiný úkol, než jaký model viděl při ladění.

U zákazníků se přenos mezi různými ztělesněními obvykle láme kvůli běžným změnám. Geometrie kamer a poddajnost koncového efektoru se mění i po předání zákazníkovi, fixační body se posouvají s provozem zákazníka a kontaminace se hromadí v průběhu týdnů směn, dokud se zotavovací chování nestane nespolehlivým. Tento posun mezi robotem, který prošel akceptací, a robotem fungujícím v reálném provozu zákazníka se označuje jako „posun na pracovišti“ (site drift).

Doménová randomizace trénuje napříč mnoha simulovanými variacemi, ale provoz každý den přináší nové. Příkaz může zachovat stejný vysokoúrovňový záměr, a přesto vést k jinému výsledku, pokud se kontakt přenese jinou zátěžovou cestou. Jedna strana mechanismu se může opřít o rám jinak než druhá, takže pohyb, který funguje jedním směrem, může v opačném směru způsobit tažení, kymácení nebo ztrátu kontaktu. Vyhlazení povelu v takovém případě nenapraví chování, jehož skutečnou příčinou je špatné časování.

Modely zohledňující konkrétní ztělesnění robota snižují jeden ze zdrojů problému tím, že popisují hardware robota pomocí kinematiky, vlastností kloubů, promptů nebo tokenů. Politika, která počítá s limity kloubů a dynamikou pohonů, vychází z lepšího popisu systému. Některé neznámé veličiny se tak stávají měřenými parametry, ale toto měření začíná zastarávat hned, jak robot vstoupí do provozu – mění se tření, opotřebovává se nářadí a zátěž se liší podle procesu. Lepší modely hardwaru dělají nasazení diagnostikovatelnějším, nikoli však univerzálním.

Na skutečné výrobní lince je první kontrola často prozaická: tým porovná poslední dobrý cyklus s cyklem, kde došlo k chybě, ještě než začne vinit samotnou politiku. Změna se projeví v poloze, v odběru proudu nebo v posunu fixačního bodu kolem úkolu. Model přitom může produkovat přesně to, co produkoval během akceptačních testů, zatímco místní úkol se od dat, na nichž byl trénován, vzdálil.

Užitečná data přicházejí až po selhání

Robotická data nesou jiné břemeno než data jazyková. Společnost Bessemer Venture Partners odhadla celkový objem globálních dat o manipulaci robotů na zhruba 300 000 hodin, oproti zhruba 1 miliardě hodin internetového videa a 300 bilionům tokenů textu. Jazykové modely mohly čerpat z internetu – roboti musí většinu svého korpusu vybudovat z nasazených strojů.

NVIDIA se snaží tento korpus rozšířit z jiného směru. Podle firmy byl model GR00T N1.7 předtrénován na více než 20 000 hodinách egocentrického videa zachycujícího lidi, nikoli teleoperace robotů, v sázce na to, že záznam z pohledu první osoby člověka v sobě nese užitečné poznatky o manipulaci.

Stejně důležitou součástí datové sady je kontext selhání, který zahrnuje stav řadiče, zotavovací akci a fyzickou příčinu. Kamera může ukázat, že robot minul cíl, ale nemusí vysvětlit, proč chapadlo ztratilo díl nebo proč se spustilo bezpečnostní zastavení. Také nemusí zachytit, jaký zotavovací pohyb buňku znovu rozběhl. Záznamy selhávají i jiným způsobem, pokud se odpojí od fyzické události – log může ukazovat pokrok podle úzké kontrolní metriky, zatímco robot viditelně „táhne“ úkol nesprávným směrem. Může se tak hromadit číslo, které software očekává, zatímco chování by bylo pro zákazníka nepřijatelné. Záznamy mají smysl jen tehdy, když je tým dokáže propojit s tím, co se skutečně odehrálo v buňce.

Teleoperace a simulace mohou generovat data ještě předtím, než se systém dostane do provozu, ale nejlepší záznamy pocházejí z instrumentovaných robotů, které běží v reálných procesech zákazníků a poskytují dostatek kontextu pro pozdější diagnostiku selhání. Firma, která dokáže proměnit historii poruch v bezpečnější zotavovací pohyby, se z každé instalace naučí víc než firma, která jen ukládá videa úspěšných cyklů. Technik musí umět odlišit selhání samotné politiky od sklouznutého nástroje, posunuté upínky nebo zotavovacího postupu, který další cyklus jen zhoršil.

Simulované budoucnosti narážejí na realitu kontaktu

Modely světa mají za úkol otestovat rozhodnutí dříve, než je v ohrožení skutečný hardware. Marble od World Labs vytváří 3D světy z promptů nebo vizuálních vstupů a exportuje je do formátů pro simulaci a kontrolu návrhu. V oblasti autonomního řízení sleduje podobnou cestu GAIA-3 od Wayve jako patnáctimiliardový model světa určený pro realistické a kontrolovatelné offline hodnocení AI pro samořízení.

Modely světových akcí (World Action Models) přibližují modelování světa blíže k samotnému řízení. DreamZero definuje architekturu jako model, který předpovídá budoucí stavy světa a akce na základě videa. NVIDIA na základě tohoto výzkumu představila model GR00T N2 a tvrdí, že uspěje v nových úkolech v nových prostředích více než dvakrát častěji než přední VLA modely a v žebříčcích MolmoSpaces a RoboArena se umisťuje na prvním místě. Podle NVIDIA má být N2 dostupný později letos.

Vygenerovaná akce musí projít přes řadič, než se promění v pohyb. Řízení vozidel je omezeno geometrií silnice a dynamikou vozidla. Manipulace naproti tomu zavádí přímý kontakt a kontakt s sebou nese poruchové stavy, které je obtížné věrně zachytit v simulaci. Uzavření síly (force closure) může být nesprávné, těsnění se opotřebovávají a kalibrace se může pomalu rozcházet, dokud linka neběží dál, až se přestane opakovat.

Simulace je užitečnější, pokud jsou tření, odezva pohonů, poloha těžiště a omezení rychlosti měřeny, nikoli pouze odhadovány. I tak musí tým udržovat simulátor kalibrovaný vůči hardwaru a sledovat bod, kdy se reálný systém od modelu odchýlí. Dobře okalibrovaný simulátor zúží prostor hledání ještě předtím, než se kdokoli dotkne hardwaru, ale nemůže nahradit kontrolu na systému provádějícím skutečné úkoly.

Skutečnou zkouškou je řadič

Výstup modelu se ke světu dostává přes řadič. Agility Robotics popsala model celotělového řízení pro robota Digit – jde o malou síť LSTM s méně než milionem parametrů, natrénovanou v simulátoru NVIDIA Isaac Sim po dobu odpovídající desítkám let simulovaného času během několika dní.

Mnoho VLA politik pracuje na úrovni úkolových akcí nebo bloků akcí. Běžná průmyslová servosmyčka se uzavírá s frekvencí kolem 1 kHz. Výstup modelu se stává užitečným až poté, co jej řadič promění v proveditelný pohyb v rámci limitů robota. Architektura pohybu může rozhodnout o výsledku ještě předtím, než řadič povel odmítne. Trasa sestavená z čistých poloh může obsahovat pauzy nebo špatné časování kontaktu. U cyklického pohybu může spojitá fáze ovlivnit výsledek víc než vyleštěná poloha a zotavovací pohyb, který v prostoru povelů vypadá konzervativně, může ke kontaktnímu bodu dorazit pozdě.

I konzervativní krok dodatečného zpracování může otevřít nové selhání tím, že posune časování kontaktu nebo zpozdí zotavovací pohyb do horší části lokální dynamiky robota. Filtrování může povel opticky vyčistit, zatímco chodidlo nebo nástroj dorazí pozdě – podobně jako zrcadlová zatáčka čtyřnohého robota vypadala v kódu symetricky, ale v kontaktu se zadrhla. U průmyslových systémů navíc bezpečnostní vrstva určuje, co smí naučená vrstva dělat, pokud si model není jistý nebo se stav stroje změnil.

Podle agentury Reuters má model Skild AI běžet na montážních linkách Foxconnu v Houstonu, kde se sestavují serverové stojany NVIDIA Blackwell GPU. NVIDIA také popsala spolupráci Skild s firmami ABB Robotics a Universal Robots. Test je tak širší než jen ověření modelu jednoho startupu na jediné lince, protože sdílená vrstva inteligence musí pokrýt zavedená robotická portfolia, aniž by obětovala servisní a bezpečnostní standardy, které tyto platformy vyžadují.

Otevřenou otázkou není jen to, který model je nejlepší. Otázkou je, zda znovupoužitelnost přijde nejdříve od reprezentace akcí, rozhraní řadiče, simulační cesty, nebo diagnostické stopy.

Co se nedá stáhnout

Skutečný „moment Llamy“ v robotice by vyžadoval, aby tým převzal model, přizpůsobil ho reprezentaci akcí svého robota, ověřil ho na svém stroji a nasadil užitečné chování bez podpory původního týmu, který model vytvořil. Provoz autonomních vozidel ukázal, že učení na úrovni celé flotily může fungovat napříč mnoha vozidly – Waymo uvádí bezpečnostní analýzy pokrývající přes 170 milionů plně autonomních mil. Manipulace s sebou nese více tření, protože pracovní buňky a produkty se liší mnohem více než geometrie silnic, a práva zákazníků k datům omezují, co může kdokoli sbírat a znovu použít.

Platforma, která získá distribuční prvenství, by se mohla pokusit sdružit data o poruchách napříč všemi instalacemi, podobně jako flotily samořídících vozidel sdružují najeté míle. Data o manipulaci robotů jsou náročná v tom, že proces každého zákazníka je jedinečný, smlouvy data oddělují a porucha na jedné lince se často nedá zobecnit na jinou. Korpus tak zůstává roztříštěný, i když samotný model roztříštěný není.

Moment Llamy v robotice nenastane ve chvíli, kdy se politika stane stažitelnou. Nastane ve chvíli, kdy jiný tým dokáže tuto politiku převzít, přizpůsobit ji svému robotu, nasadit ji do reálného procesu zákazníka a ještě o týdny později vědět, co selhalo, když linka přestane plynule fungovat.

Zdroj: therobotreport.com