KIEMELT
Az AI-biztonsági tesztek sokszor nem ugyanazt mérik, amire kíváncsiak vagyunk
Egy brit AI-biztonsági kutatás szerint az összesített benchmarkpontszámok könnyen félrevezethetnek. A modellek több eltérő tulajdonság mentén viselkednek, és akár a tesztekhez is alkalmazkodhatnak.