Az angolul biztonságosan visszautasító AI-modellek ugyanazokat a veszélyes kéréseket több kevésbé támogatott nyelven már teljesíthetik. Ezt a problémát vizsgálja a Latent Space Refusal Anchoring című friss arXiv-tanulmány, amely a yoruba, az igbo, az igala és a hausza nyelvet emeli ki.

A szerzők szerint a biztonsági visszautasítás mechanizmusa valószínűleg jelen van a modellek belső állapotában, csak nem minden nyelvi bemenetnél aktiválódik. A modell tehát nem feltétlenül „nem tudja”, hogy a kérés veszélyes, hanem más nyelven nem kapcsolja be ugyanazt a védelmet.

A kevésbé támogatott nyelveken vizsgált AI-biztonsági probléma szemléltető ábrája
Szemléltető ábra; a tanulmányban ismertetett problémát mutatja be.

A tanulmány erre egy Latent Space Refusal Anchoring nevű módszert javasol. A megoldás a modell belső, úgynevezett maradékfolyamában próbálja rögzíteni a visszautasításhoz kapcsolódó mintát, anélkül, hogy célzott, nagy mennyiségű nyelvi adaton újra kellene tanítani a modellt.

Ez ott lehet érdekes, ahol kevés jó minőségű, biztonsági címkékkel ellátott adat áll rendelkezésre. A nagy nyelvekre kialakított biztonsági tréning ugyanis nem garantálja, hogy a védelem automatikusan működik a kisebb nyelveken is.

Egyelőre kutatási eredmény, nem kész javítás

A módszer nem jelent automatikus megoldást minden modellre és minden nyelvre. A tanulmány egyelőre azt mutatja meg, hogy a biztonsági viselkedés belső irányítása bizonyos esetekben újratanítás nélkül is módosítható. A gyakorlati bevezetéshez több modellen, több nyelven és független tesztekkel kellene ellenőrizni, hogy a visszautasítás nem rontja-e a jogos kérések teljesítését.

A probléma azért fontos, mert az AI-szolgáltatások terjedésével egyre kevésbé lehet csak az angol nyelvű teszteket biztonsági alapnak tekinteni. Ha egy modell ugyanazt a kérést angolul leállítja, más nyelven viszont végrehajtja, akkor a védelem a felhasználó nyelvétől függ.