A Mistral hivatalos bejelentése szerint a vállalat nyílt súlyú, 3 milliárd paraméteres biztonsági modellt adott ki. A Shieldstral 1.0 3B nem egyetlen, előre rögzített veszélylistát tanul meg, hanem a futtatáskor kapott természetes nyelvű kérdés alapján dönti el, hogy egy szöveg vagy kép megfelel-e a megadott szabálynak.

// ai/mi · 2026.08.05A kiberes tesztből valódi emberek lettek célpontokA biztonsági tesztekben használt AI-modellek már nem mindig maradnak a labor falain belül.olvasás →

A moderálási szabály nem a modellbe van beégetve

A legtöbb biztonsági osztályozó előre meghatározott kategóriákat használ: például erőszak, gyűlöletbeszéd vagy önkárosítás. Ez működhet egy adott szolgáltatásnál, de ha másik termékben akarják használni, gyakran újra kell tanítani vagy finomhangolni a modellt.

A Shieldstral ehelyett egy igen/nem kérdést kap. A fejlesztő megadhatja például, hogy „Ez a kép biztonságos egy kiskorúaknak szánt felületen?”, vagy azt, hogy „Tartalmaz-e a válasz kiberbiztonsági visszaéléshez használható utasítást?”. A modell egy folyamatos biztonsági pontszámot ad, amely alapján a rendszer blokkolhat, emberi ellenőrzésre küldhet vagy átengedhet egy tartalmat.

Kis méret, helyi futtatás

A Mistral szerint a modell egyetlen, 16 GB memóriával rendelkező GPU-n is futtatható, és Apache 2.0 licenc alatt érhető el. Ez azért fontos, mert a moderálásnál sok cég nem szeretné minden felhasználói képet vagy szöveget külső szolgáltatóhoz továbbítani. A Shieldstral helyben, saját szerveren vagy zárt felhős környezetben is bevethető.

A modell szöveges, képi és szöveg-kép kombinációs tartalmakat is értékel. A Mistral beszámolója szerint a rendszer egyetlen előremenettel, csak az igen és a nem token valószínűségét olvassa ki, ezért gyors és olcsó lehet egy nagyobb nyelvi modellhez képest.

A számok jól hangzanak, de a korlátok is megmaradnak

A vállalat tesztjeiben a Shieldstral 84,9 százalékos átlagos F1-értéket ért el szöveges biztonsági feladatokon, ami megegyezett egy nála jóval nagyobb modell eredményével. Multimodális teszteken 83,8 százalékos értéket közölt. Ezek a Mistral saját összehasonlításai, ezért a számokat nem érdemes minden lehetséges feladatra általánosítani.

A technikai jelentés szerint a modell gyengébben teljesít egyes alacsony erőforrású nyelveken, obfuszkált utasításokon és nagyon hosszú dokumentumokon. Ez különösen fontos, mert a valós támadások gyakran nem tiszta, rövid kérdésekkel érkeznek.

A nyílt modell nem egyenlő a kész biztonsági rendszerrel

A Shieldstral legérdekesebb része nem az, hogy kiváltja-e az összes nagy moderációs modellt. Inkább az, hogy a szabályt elválasztja a modelltől: ugyanaz a 3B-s checkpoint más kérdéssel más környezethez igazítható. A végső biztonságot azonban továbbra is a küszöbértékek, a naplózás, az emberi ellenőrzés és a rendszer többi védelmi rétege adja.