// ai/mi · 2026.07.16 A Kimi K3 nagyot lép, de az olcsó kínai AI régi képe közben kopik A Kimi K3 hivatalosan 2,8 billió paraméteres modell, 1M tokenes kontextussal és natív képi megértéssel. A kérdés már nem csak az, mennyire erős, hanem az… olvasás →

Az új nyelvi modellek egyre ügyesebben érvelnek, kódolnak és foglalnak össze, de attól még nem biztos, hogy jól látják, mi történik előttük. A Moonshot AI hivatalos PerceptionBench-bemutatója szerint a 16 vizsgált modell közül egyik sem érte el a 60 százalékos összesített eredményt. A teszt nem általános „okosságot” próbál mérni, hanem tíz apró, konkrét vizuális készséget, amelyekre egy kép értelmezése közben külön-külön is szükség van.

A benchmark 3000 ellenőrzött kérdést tett közzé egy több mint 17 ezer feladatból álló készletből. A Moonshot AI szerint a kérdések mintegy 60 százaléka korábbi modellek hibáiból kiindulva készült, a többit újonnan írták. Ettől a teszt nem lesz tökéletes, de jóval közelebb kerül ahhoz, amit a felhasználók a gyakorlatban tapasztalnak: egy modell nemcsak azt ronthatja el, hogy mit következtet egy képről, hanem már azt is, hogy mit lát rajta.

Nem az érvelés a fő akadály

A PerceptionBench tíz kategóriát különít el: ilyen a tárgyak közötti viszonyok felismerése, a számlálás, a tulajdonságok azonosítása, a mélység és a 3D-s helyzet értelmezése, a lokalizáció, az összehasonlítás, a finom részletek felismerése, a kontextus összerakása, az OCR és a hallucinációk felismerése. Ez azért lényeges, mert egy hibás válasz mögött nem mindig gyenge gondolkodás áll. Lehet, hogy a modell rossz helyre tette a képen szereplő tárgyat, kihagyott egy apró részletet, vagy egyszerűen kitalált valamit, ami nem volt ott.

A Moonshot AI PerceptionBench hivatalos ábrája négy vizuális észlelési feladattal
Kép: Moonshot AI / Kimi PerceptionBench

Az élmezőny is hatvan százalék alatt maradt

A rangsor elején a GPT-5.6 Sol 59,7 százalékkal végzett, mögötte a Kimi K3 58,5, a Claude Fable 5 57,2, a Gemini 3.1 Pro 56,2, a GPT-5.5 pedig 55,8 százalékot ért el. A The Decoder összefoglalója szerint a leggyengébb rész több modellnél a hallucinációk kiszűrése volt. A GPT-5.6 Sol ebben a kategóriában mindössze 26,9 százalékot hozott, miközben a legjobb eredmény is csak 50,6 százalék körül alakult.

A nyílt modellek sem kerültek a közelükbe: a Qwen3.5-397B-A17B 47,5, a GLM-4.6V 32,5 százalékon állt. Ez nem azt jelenti, hogy használhatatlanok, hanem azt, hogy a képi pontosságot nem lehet pusztán a modell méretével vagy a szöveges benchmarkok eredményeivel leírni. Azonosítható különbség van aközött, hogy egy rendszer folyékonyan magyaráz valamit, és aközött, hogy valóban helyesen olvassa le a képet.

Miért számít ez a hétköznapokban?

Vizuális AI-t használunk dokumentumok, képernyőképek, műszaki rajzok és fotók értelmezésére is. Ha a modell egy apró feliratot, egy darabszámot vagy egy veszélyre utaló részletet néz be, a hiba nem feltétlenül látszik a magabiztosan megírt válaszon. A PerceptionBench ezért inkább józanító ellenőrzés, mint újabb versenytábla: megmutatja, hogy a „látás” még külön fejlesztési probléma, és a képalapú válaszokat továbbra is érdemes visszaellenőrizni.