A Dyna Robotics új modellje nem szövegből próbálja kitalálni, mit kell tennie egy robotnak. A Dyna-2 hivatalos kutatási oldala szerint a rendszer több mint egymillió órányi, emberi nézőpontból rögzített videóból tanulja meg a mozdulatok logikáját, majd ezt a tudást robotkarokon viszi át.
A vállalat ezt World Action Modelnek, vagyis világ-akciómodellnek nevezi. A Dyna-2 nem csak azt próbálja megjósolni, mi látszik a következő képkockán, hanem azt is, milyen cselekvés következik utána. Ez fontos különbség a klasszikus, előre programozott ipari robotokhoz képest: a modellnek nem minden helyzetre külön szabálykönyvből kell választania.

Emberi videókból robotmozdulat
A Dyna leírása szerint a tanítóanyag nagy része első személyű emberi videó, amelyben hétköznapi manipulációs feladatok láthatók: főzés, pakolás, hajtogatás és szerelés. A cég kézpozíciókat is követ a felvételeken, így nem pusztán tárgyakat és képeket lát, hanem azt a mozdulatsort is, amely egy tárgy megfogásához vagy elfordításához vezet.
A modell videódiffúziós gerincre és transzformer-alapú komponensekre épül. A jövőbeli képkockák és akciók előrejelzése közösen történik, ezért a robot nem kizárólag a következő egyetlen mozdulatot keresi. A megközelítés célja, hogy különböző robottesteken is működjön, ne csak azon a hardveren, amelyen az adatfelvétel történt.
Mit mutat a vállalat mérése?
A Dyna egy 39 feladatból álló, két YAM-platformon végzett robottesztet ír le. A modell a közölt mérésben 20 százalékos átlagos normalizált teljesítményről 53 százalékra jutott, amikor a tanító videók mennyisége ezer óráról egymillió órára nőtt. A Dyna-2 a 14 vizsgált feladatból kilencben adta a legjobb eredményt. Ezek a számok a cég saját kutatási eredményei, független reprodukciót a közlemény nem mutat be.
A bemutatott példák között szerepel egy zár kulcsának elfordítása és egy palack kupakjának lecsavarása. Utóbbihoz a kutatók mindössze tíz perc teleoperációs finomhangolást említenek. A Dyna-2 korai összevetésében a Dyna-1-hez képest 1,55-szörös sikerarányt közölnek, de ez is vállalati benchmark, nem általános iparági mérce.
A laborból a munkafolyamatokba
A Dyna otthoni bemutatkozó anyaga már konkrét feladatkapacitásokat is említ: a rendszerük állítólag óránként száz ruhaneműt képes feldolgozni, étel- és vendéglátási környezetben 180, gyári munkánál pedig 200 egységet. A cég a gyártási feladatoknál plusz-mínusz két milliméteres pozicionálási pontosságot ad meg. Ezek megvalósított alkalmazásként szerepelnek a vállalati anyagban, ezért érdemes őket a Dyna állításaiként kezelni, amíg külső tesztek nem erősítik meg őket.
A Dyna-2 mögötti ötlet ettől még jól érthető: a robotnak nem kell minden új tárgyhoz teljesen új program. Ha a modell tényleg át tudja vinni az emberi videókból megtanult mozdulatokat eltérő környezetekbe, az a betanítás idejét csökkentheti. A nehezebb kérdés továbbra is a biztonság, a hibák felismerése és az, hogy mennyire stabil a működés olyan helyzetekben, amelyeket a tanítóvideók nem fednek le.