A Claude Opus 5 30,16 százalékot ért el az ARC-AGI-3 teszten. Az ARC Prize július 24-én közzétett, ellenőrzött eredménye szerint ez jelenleg a benchmark legjobb pontszáma. Az OpenAI GPT-5.6 Sol (Max) korábbi 7,8 százalékához képest nagy az ugrás, de a számot könnyű félreérteni: nem általános intelligenciahányadost, hanem egy szokatlanul nehéz, interaktív feladatsor teljesítését mutatja.

// ai/mi · 2026.06.20 Az OpenAI mindenkinek személyes AI-ügynököt akar adni – de ki fizeti az árát? Az OpenAI legutóbbi nyilvános kommunikációja szerint a cég végső célja nem csupán egy hasznos chatbot, hanem egy valóban mindenható, személyes AI-ügynök, amely a Földön élő… olvasás →

Ezen a teszten nem elég jó választ adni

Az ARC-AGI-3 eltér a megszokott kérdés-válasz benchmarkoktól. Több száz, emberek által készített, körökre osztott környezetből áll, amelyekhez a modell nem kap szabályleírást, utasítást vagy előre megadott célt. Saját próbálkozásokból kell rájönnie, hogyan működik a pálya, mi számít sikernek, és melyik korábbi tapasztalatot érdemes átvinni a következő szintre. Vagyis nem elég felismerni egy tanult mintát: fel kell térképezni egy ismeretlen rendszert.

Amikor az ARC Prize márciusban bemutatta a tesztet, az emberek 100 százalékos eredményével szemben a legerősebb AI-rendszerek mindössze 0,51 százalékon álltak. A mostani 30,16 százalék ezért valódi előrelépés. Az összehasonlítást ugyanakkor árnyalja, hogy a rövid tesztelési idő miatt az Opus 5-öt az ARC-AGI-3-on csak High következtetési beállítással mérték, a Max változathoz még nincs ellenőrzött pontszám.

A Claude Opus 5 és más AI-modellek ARC-AGI-3 eredményei
Forrás: ARC Prize

Öt pályán ott jutott tovább, ahol korábban senki

A pontszámnál beszédesebb, hogy az Opus 5 öt olyan nyilvános demókörnyezetet is teljesített, amelyet korábban egyetlen vizsgált modell sem tudott megoldani. Ez arra utal, hogy a rendszer bizonyos helyzetekben jobban kezeli a felderítést, a visszajelzések értelmezését és a stratégia menet közbeni módosítását. A nyilvános eredményoldal a sikeres pályákat és a pontszámokat közli, a modell belső lépéseit viszont nem dokumentálja részletesen. Az eredményből ezért csak óvatosan lehet arra következtetni, pontosan milyen stratégiát használt.

Az Anthropic saját bemutatója úgy fogalmaz, hogy az Opus 5 pontszáma háromszorosa a következő legjobb modellének. A 30,16 és az OpenAI korábbi 7,8 százalékos rekordja közötti különbség viszont közel négyszeres. Nem ugyanaz a két viszonyítási pont: az egyik a mostani mezőny második helyezettje, a másik a korábbi csúcs. A biztos kapaszkodót az ARC Prize ellenőrzött pontszámai adják.

A 30 százalék még nagyon messze van az emberi szinttől

Egy benchmarkrekord önmagában nem bizonyítja az általános mesterséges intelligencia elérését. Az ARC-AGI-3 tudatosan szűk, bár nehéz képességet mér: azt, hogyan alkalmazkodik egy rendszer ismeretlen, interaktív helyzetekhez. Nem derül ki belőle, mennyire megbízható hosszú távon, hogyan teljesít valós vállalati környezetben, vagy miként kezeli a bizonytalan és egymásnak ellentmondó információkat. Az emberi 100 százalékhoz képest ráadásul a pályák több mint kétharmada továbbra is megoldatlan maradt.

Az eredmény mégis fontos, mert az AI-ügynökök egyik legnagyobb gyengeségére mér rá. Egy modell sokszor jól követ részletes utasításokat, de könnyen elakad, ha magának kell felismernie a célt és kijavítania a rossz feltételezéseit. Az Opus 5 most ezen a területen mutatott látványos javulást. A rekord tehát nem az AGI megérkezését jelzi, hanem azt, hogy az ismeretlen helyzetekben való önálló tájékozódásban a modellek már nem csak apró lépésekben haladnak.