eTEC.NEWS je komunitní web zaměřený na technologie, umělou inteligenci, roboty, solární energii, elektromobilitu, produkty a služby z těchto oblastí.

Avride používá cloudové VLM jako záchrannou síť pro doručovací roboty

Avride používá cloudové VLM jako záchrannou síť pro doručovací roboty

Firma Avride staví své doručovací roboty na vysoké míře autonomie. Každý den se jich stovky pohybují po rušných městských ulicích zcela samostatně a zpracovávají složitá senzorická data lokálně na palubních výpočetních jednotkách. Chodníkoví roboti zvládají běžné městské manévry, chodce i semafory bez zásahu člověka.

Efektivní zvládnutí mechaniky navigace — i v obtížných podmínkách, jako jsou úzké průchody nebo špatné počasí — je však jen částí rovnice. Aby se robot choval přiměřeně v neobvyklých, citlivých či rizikových situacích, je potřeba jiný druh inteligence. Proto Avride do svého systému integrovala výpočetně náročné cloudové modely typu vision-language (VLM) jako automatizovaného „VLM-pozorovatele“.

Od detekce objektů k pochopení celé scény

Palubní vnímací stack robotů je už dnes velmi schopný. Kombinací senzorů a lokálních neuronových sítí dokáže rozpoznat okolní aktéry včetně cyklistů, dětí, invalidních vozíků a vozidel záchranných složek. Jenže zatímco palubní modely identifikují jednotlivé prvky, některé reálné scénáře vyžadují mnohem hlubší vrstvu porozumění kontextu.

Představme si situaci na ulici. Přítomnost policisty nebo hasiče na chodníku může naznačovat, že se děje něco neobvyklého — základní detekce objektů však celkový obraz nezachytí. Rozlišit policistu, který se po směně vrací domů, od aktivního a citlivého místa činu je vysoce netriviální úloha. Vyžaduje celostní pochopení toho, jak spolu jednotlivé prvky v záběru interagují: interpretaci scény jako celku, ne jako pouhého seznamu detekovaných objektů.

Cílem je výrazně snížit pravděpodobnost, že robot omylem vjede do aktivní zóny záchranné akce, projede přes živé místo činu nebo se dostane do nezmapovaných stavebních prací, kde čerstvý mokrý beton vypadá jako obyčejný šedý chodník. Palubní modely zachytí základní entity potřebné k navigaci, kdežto těžký základový model v cloudu vyniká právě v celostní interpretaci a okamžitě poskládá hluboký sémantický kontext celé situace.

Jak to funguje: VLM jako cloudový strážce

Je důležité jedno vyjasnit: VLM robota neřídí. Používat těžký cloudový model k řízení v reálném čase by přineslo latenci a závislost na konektivitě, což by ohrozilo bezpečnost. Model místo toho slouží jako automatizovaný systém včasného varování pro tým vzdálené asistence.

Během autonomní jízdy robot každých několik sekund odesílá do cloudu snímek ze svých kamer. Kvůli ochraně soukromí veřejnosti jsou všechna obrazová data anonymizována přímo na robotu — obličeje a registrační značky se rozmazávají lokálně, ještě než snímek opustí palubní výpočetní jednotku. V cloudu VLM-pozorovatel proud snímků zpracuje a převede vizuální data do sémantického popisu dění na ulici. Model je veden podrobným promptem, který přesně definuje, jaké typy neobvyklých, citlivých či složitých situací má hledat; scénu podle těchto instrukcí vyhodnotí a přiřadí jí konkrétní rizikové značky. Označí-li model kritickou situaci, okamžitě upozorní tým vzdálené asistence. Operátor pak může zkontrolovat živý přenos a zajistit, aby robot dal přednost záchranářům nebo se držel mimo omezené zóny.

Protože se prostředí AI vyvíjí závratným tempem, Avride svou infrastrukturu neváže na jediného poskytovatele. Cloudovou vrstvu pojímá jako otevřenou architekturu typu plug-and-play a průběžně testuje a porovnává nejnovější modely.

Od dolování dat k živému provozu

Nasazení VLM do každodenního provozu je přirozeným vývojem interních inženýrských nástrojů. Ukládat a zpracovávat každou minutu videa ze stovek robotů denně by bylo nesmírně drahé a zbytečné — smysl dává uchovat jen data, která skutečně pomáhají zlepšovat technologii a udržovat bezpečnost.

Firma proto stejnou pipeline s analýzou pětisekundových živých přenosů původně používala jako nástroj filtrování dat: cloudové VLM prohledávaly proudy v reálném čase a automaticky vyhledávaly vzácné, hodnotné scénáře — třeba specifické interakce se zvířaty nebo složitou infrastrukturu — které pak bylo možné bezpečně uložit v předem anonymizované podobě pro další značkování a trénink.

Když se ukázalo, že pipeline dokáže jedinečný kontext rozpoznávat živě a mimořádně přesně, bylo logickým krokem rozšířit ji do ostrého provozu. Pokud systém už umí identifikovat unikátní kontexty v reálném čase, může stejně dobře spouštět i živý lidský dohled.

Kam dál: VLM na okraj sítě

Provozovat těžké modely v cloudu je dnes velmi účinné řešení, ale je to teprve začátek. S tím, jak se VLM díky optimalizačním technikám zmenšují a jak sílí palubní hardware nové generace, se má tato hluboká sémantická vrstva nakonec přesunout z cloudu přímo do výpočetní jednotky robota. To umožní ještě hlubší autonomní rozhodování zcela na okraji sítě, nezávisle na síťovém připojení. Do té doby má bezpečnostní síť složená z cloudu a vzdálené asistence zajistit, aby doručovací roboti Avride zůstali zdvořilými, zodpovědnými a vnímavými občany chodníku.

Text vychází z autorského článku Romana Nefedova, který v Avride vede autonomní doručování.

Zdroj: therobotreport.com