// ai/mi · 2026.07.30 A Gemini már lábtól az ujjhegyig irányít egy humanoidot A Google DeepMind Gemini Robotics 2 modellje már az Apptronik Apollo 2 teljes testét vezérli. A bemutatók látványosak, de a mérési eredmények és a korlátozott… olvasás →

Június elején a kínai Spirit AI nagyot szólt: Spirit v1.6 nevű robotikai modellje 1924 ponttal az élre ugrott a RoboArena ranglistáján, megelőzve az Nvidia két rendszerét. Két hónappal később már nem az volt a legérdekesebb kérdés, hogy Kína tényleg legyőzte-e az Nvidiát, hanem az, hogy mennyit ér egy olyan ranglista, amelynek értékeléseit részben maguk a résztvevő szervezetek futtathatták.

A South China Morning Post augusztus 4-i vizsgálata szerint a RoboArena készítői időközben átalakították a módszertant, és utólag eltávolítottak olyan értékeléseket, amelyek manipulációban érintett szervezetektől származtak. Pranav Atreya, a benchmark egyik vezető szerzője nyilvánosan beszélt a törlésről, de cégeket nem nevezett meg.

A RoboArena elosztott, valós robotokon végzett értékelési módszerének ábrája
A RoboArena valós robotokon, több helyszínen és páros összehasonlításokkal értékeli a modelleket. Forrás: RoboArena

Az egyik értékelőnél 99 százalék volt a győzelmi arány

A gyanút nem önmagában az első hely keltette. A kínai Roushen Suanfa technológiai blog több mint 4600, június 3-áig rögzített értékelést elemzett. A számításaik szerint az ECUST Robot Lab nevű fiók futtatta a Spirit v1.6 értékeléseinek 58 százalékát. Ennél a fióknál a modell 99 százalékos győzelmi arányt ért el, a független értékelőknél viszont 66 százalékot.

Ez nagyon nagy eltérés, de önmagában még nem bizonyít csalást. Az SCMP nem tudta igazolni, hogy az ECUST Robot Lab fiók kapcsolatban állt volna a Spirit AI-jal. A vizsgálat ráadásul arra is rámutatott, hogy a probléma nem kizárólag a kínai modellnél jelent meg: az akkori öt legerősebb rendszer mindegyikének értékelései legalább fele részben egyetlen fiókra koncentrálódtak.

A régi rendszerben az értékelő és a modellszerver túl közel került egymáshoz

A RoboArena eredeti célja kifejezetten értelmes: általános robotikai modelleket nem egyetlen laborban és néhány előre berendezett feladattal mér, hanem különböző helyszíneken, valódi robotokon, páros összehasonlításokkal. Az értékelő ugyanazt a feladatot adja két modellnek, de nem tudja, melyiket látja. Sok ilyen próba eredményéből áll össze a rangsor.

A korábbi, nyitottabb változatban azonban szinte bárki regisztrálhatott értékelőként, miközben a beküldött modellek a fejlesztők saját szerverein futottak. Ez elméletileg lehetőséget adott arra, hogy egy modell szervere csak akkor legyen elérhető vagy gyors, amikor egy számára kedvező értékelő használja. A nyilvánosságra került adatok nem bizonyítják, hogy pontosan ez történt, viszont megmutatják, miért volt támadható a rendszer.

Az SCMP szerint a régi rekordok később eltűntek a benchmark oldaláról. A RoboArena ugyanakkor július 17-i nyilvános adatmentést is közzétett a Hugging Face-en, és az új rendszerben már ellenőrzött, független önkéntesek futtatják a hivatalos értékeléseket. A hivatalos listára kerüléshez legalább száz ellenőrzött próba szükséges.

A Spirit v1.6 nem tűnt el, csak másik listán maradt

A Spirit v1.6 jelenleg az alacsony mintaszámú, nem hivatalos listán szerepel, 25 értékeléssel. A száz próbás küszöböt teljesítő hivatalos rangsort az Nvidia DreamZero vezeti. A Spirit AI az SCMP-nek azt mondta, hogy a modell hiánya főként a mintaszám következménye, és nem annak beismerése, hogy a képességei ne lennének valósak.

Az Nvidia, a RoboArena és egy másik érintett kínai robotikai vállalat, az X Square nem válaszolt a lap kérdéseire. Emiatt a történet vége egyelőre nem az, hogy a Spirit AI-t csaláson kapták. A biztos állítás az, hogy a benchmark készítői manipulációra utaló értékeléseket találtak, visszamenőleg töröltek adatokat, majd szigorúbb módszertant vezettek be.

Egy robotikai ranglista nem csak a modellt méri

A RoboArena esete jól mutatja, hogy a fizikai AI értékelése nehezebb, mint egy nyelvi modellnek kérdéssort adni. Más robot, kameraállás, fény, tárgy, hálózati kapcsolat és emberi döntés kerülhet minden próba mögé. Ha ehhez a résztvevők saját szervere és egy túl nyitott értékelői rendszer társul, akkor a rangsor legalább annyira méri az infrastruktúrát, mint magát a modellt.

A kínai modell júniusi első helye ezért nem lett automatikusan hamis, az Nvidia mostani vezetése pedig nem lett örök igazság. A tanulság prózaibb: egy látványos pontszám előtt érdemes megnézni, ki, hányszor és milyen feltételekkel futtatta a tesztet. A RoboArena szigorítása ebbe az irányba tett szükséges lépés.