A számítógépes grafikus felületeket közvetlenül kezelő autonóm AI-ágensek (Computer-Use Agents, CUA) betanításának legfőbb szűk keresztmetszete nem a modellek logikájában, hanem a tesztkörnyezetek memóriaterhelésében és inicializálási késleltetésében rejlik. A UC Berkeley kutatócsoportja által közzétett CUA-Lite platform dokumentációja és mérési adatai szerint a hypervisor-alapú virtuális gépek Docker-konténerekre való cseréje feladatonként 78%-os memóriamegtakarítást és 4,6-szoros párhuzamosítási kapacitást eredményez azonos hardvererőforrás mellett.
Infrastrukturális korlát: a QEMU/KVM virtualizáció terhelése
A számítógép-vezérlő ágensek tesztelésének elterjedt referenciarendszere az OSWorld benchmark. Ez a környezet feladatonként egy teljes értékű QEMU/KVM virtuális gépet indít el, amely példányonként 4,1 gigabájt memóriát köt le, az átlagos hidegindítási ideje pedig 29,9 másodperc. A megerősítéses tanulási (RL) algoritmusokhoz – mint a PPO vagy a DPO – több száz párhuzamos futtatási környezetre van szükség, a hardveres beágyazott virtualizáció (nested virtualization) és a magas memóriaigény azonban ezt a kutatói laborok többsége számára technikai akadállyá tette.
A CUA-Lite a Lite.OSWorld alrendszer révén a virtuális gépeket szabványos Linux Docker-konténerekbe szervezi át. Az architektúraváltás pontos mérési paraméterei:
- Memóriafelhasználás: Asztali környezetenként 4,1 GB-ról 0,9 GB-ra csökkent, ami 78%-os memóriamegtakarítás.
- Hidegindítási késleltetés: 29,9 másodpercről 23,8 másodpercre rövidült le egy-egy új feladatkörnyezet inicializálása.
- Párhuzamosítási hatásfok: Ugyanazon a fizikai szerverhardveren 4,6-szor több párhuzamos ágens-példány futtatható egyidejűleg.
- Mérési hűség: A konténerizált környezetben elért feladatteljesítési ráták statisztikailag szignifikáns eltérés nélkül megegyeznek az eredeti OSWorld VM-eken mért referenciaértékekkel.
Determinisztikus adatséma és Gymnasium interfész
A környezet az adatséma és a vezérlési felület egységesítésére a gépi tanulásban szabványos Gymnasium API mintáját alkalmazza. A tesztkörnyezet a gym.make() hívással inicializálható, az ágens pedig a step() és reset() metódusokon keresztül kapja meg a képernyőmentésekből álló megfigyelési teret, valamint küldi vissza a koordináta-alapú egérmozgásokból és billentyűparancsokból álló cselekvési teret.
A keretrendszer több mint 30 000 determinisztikusan ellenőrizhető feladatot támogat 15 integrált benchmarkon és mintegy 40 asztali alkalmazáson keresztül. A tesztelt környezetek között szerepel a VS Code forráskód-szerkesztő, a Blender 3D-modellező, a QGIS térinformatikai szoftver, a PyMOL és különféle mechanikai CAD-eszközök. A Linux asztali felületek mellett a böngészős automatizáció és a WindowsAgentArena révén a Windows 11-es alkalmazások vezérlése is támogatott.
A számítógép-vezérlő ágensek skálázhatósága a hypervisor-szintű virtualizáció elhagyásán és a folyamatszintű konténerizáció feladatspecifikus optimalizációján múlik.