KIEMELT
A több modellre épülő szavazás sem védi ki a közös tévedést
Egy friss GPT-4.1-es vizsgálat szerint a több modellválaszra épülő többségi szavazás nehéz kérdéseknél akár vissza is üthet.
KIEMELT
Egy friss GPT-4.1-es vizsgálat szerint a több modellválaszra épülő többségi szavazás nehéz kérdéseknél akár vissza is üthet.
A Moonshot AI PerceptionBench tesztjén 16 modell közül egyik sem érte el a 60 százalékos összesített eredményt vizuális percepcióban.
A Claude Opus 5 30,16 százalékot ért el az ARC-AGI-3-on. Nagy ugrás, de a benchmark emberi szintjétől még messze jár.
A Prime Intellect Verifiers v1 külön kezeli a feladatot, az AI-ügynököt és a futtatási környezetet, hogy a kódoló modellek tesztjei…