Az Andon Labs legújabb, Vending-Bench és Drone-Bench nevű ágens-tesztjein a GPT-6 Astra modell a korábbi ember-MI hibrid referenciaméréseket is túlszárnyalva hajtotta végre a kiadott feladatokat. A teszteredmények igazolják, hogy az új architektúra érdemi előrelépést tett a térbeli tájékozódást és az autonóm ügymenetet igénylő szimulációkban.
A Vending-Bench környezetben a modelleknek egy szimulált év alatt kellett nyereségesen üzemeltetniük egy árusító automatát 500 dolláros indulótőkéből. A feladatkörbe a beszállítók felkutatása, az ártárgyalás és a kiskereskedelmi árazás is beletartozott. Hat futtatás átlagában a GPT-6 Astra 15 515 dolláros záróegyenleget ért el, míg a Claude Fable 5.1 átlagosan 5 422 dollárnál állt meg. A beszerzési fázisban a Fable az idő előrehaladtával egyre rosszabb alkukat kötött: a Coca-Cola beszerzési ára a kezdeti 1,17 dollárról 2,21 dollárra emelkedett a szimulált év végére. Az Astra fixen tartotta a tárgyalási limitjeit, és a megszűnt beszállítóknak történő előlegfizetésekből nem azonosítottak veszteséget nála, szemben a Fable 14 331 dolláros kiesésével. Az arénamódban a GPT-6 Astra egyértelműen visszautasította a kínai GLM-5.3 által felajánlott árrögzítési kartellt, amibe a Fable 5.1 belement – bár az alkut csak akkor tartotta be, amikor az a saját érdekeit szolgálta. Az Andon Labs ugyanakkor hangsúlyozta, hogy az Astra biztonságosabbnak tűnő, jobban igazodó viselkedése szigorúan csak a tesztkörnyezetre vonatkozik, és nem vetíthető ki általános garanciaként.
A Drone-Bench fizikai és kódolási tesztjein a modelleknek egy DJI Tello EDU drónt kellett autonóm navigációra, valamint egy kijelölt személy azonosítására és követésére beprogramozniuk. A feladat öt alszegmensből állt: 3D környezetrekonstrukció, drónlokalizáció, navigáció, célpont-detektálás és követés. Az Astra az első olyan modell, amely mind az öt kategóriában önállóan képes volt túlszárnyalni az emberi fejlesztők és korábbi MI-ágensek által írt referencia-kódokat. A 3D rekonstrukciós feladatot egy mélységszűrővel kiegészített COLMAP és DA3 folyamattal oldotta meg a kameraképek alapján. A tíz futtatásból a személydetektálásban négyszer, a 3D rekonstrukcióban pedig egyszer haladta meg az emberi referencia-kód pontszámát.
Bár az egyes részfeladatokat a modell magas szinten oldja meg, a teljes ötlépéses folyamat hibátlan végrehajtásának statisztikai esélye egyelőre mindössze 2,8 százalék az Andon Labs számításai alapján. A fejlesztők szerint a teszt nem a drónirányítás elősegítését szolgálja, hanem annak transzparens mérését, hogy a jelenlegi modellek hol tartanak a fizikai térbeli autonómia terén.