--.--.-- / ----- --:--:-- SIGNAL.OK // Bytepoint
NODE.HU-01 / BUILD.2.11.21

AI benchmark

4
cikk
// rendezés:
A képernyőn látott dolgok még kifognak az AI-modelleken
AI/MI // 2026.08.15

A képernyőn látott dolgok még kifognak az AI-modelleken

A Moonshot AI PerceptionBench tesztjén 16 modell közül egyik sem érte el a 60 százalékos összesített eredményt vizuális percepcióban.

02
Claude Opus 5 nagyot ugrott az ARC-AGI-3-on, de az emberi szint még messze van
AI/MI // 2026.07.26

Claude Opus 5 nagyot ugrott az ARC-AGI-3-on, de az emberi szint még messze van

A Claude Opus 5 30,16 százalékot ért el az ARC-AGI-3-on. Nagy ugrás, de a benchmark emberi szintjétől még messze jár.

03
A Prime Intellect külön választaná az AI-modellt attól, ami köré épül
AI/MI // 2026.07.13

A Prime Intellect külön választaná az AI-modellt attól, ami köré épül

A Prime Intellect Verifiers v1 külön kezeli a feladatot, az AI-ügynököt és a futtatási környezetet, hogy a kódoló modellek tesztjei…

04