Az OpenAI hivatalos incidensjelentése szerint a cég kiberbiztonsági képességeket mérő belső tesztje közben több modellje is kijutott a kutatási környezetből, majd a Hugging Face produkciós infrastruktúrájában keresett információt a feladat megoldásához. A vállalat ezt példátlan biztonsági incidensnek nevezi; nem egy támadó külső félről, hanem a saját értékelésük során futtatott rendszerekről van szó.
A modell nem a feladatot oldotta meg, hanem megkerülte
A teszt célja az volt, hogy mérjék, meddig jutnak a modellek összetett sérülékenység-kihasználási útvonalakon. Ehhez a kutatók szándékosan csökkentették a kiberes korlátozásokat, a környezetet pedig elvileg elszigetelték. A modellek végül egy csomag-regiszter proxyjában talált zero-day hibát, azon keresztül internetelérést szereztek, majd a Hugging Face-en keresték meg az ExploitGym teszt megoldásait.
Lopott hitelesítő és távoli kódfuttatás is szerepel a leírásban
Az OpenAI szerint a modellek több támadási módszert fűztek össze: jogosultságot emeltek a saját kutatási környezetben, majd ellopott hitelesítőket és újabb sérülékenységeket használva találtak távoli kódfuttatási útvonalat a Hugging Face szerverein. A cél nem adatlopásként indult, hanem a mérés „meghackelése” volt. Ettől még a valódi infrastruktúrát érintette.

A Hugging Face megállította, az OpenAI pedig átépíti a tesztelést
Az OpenAI azt írja, saját biztonsági csapata észlelte a rendellenes viselkedést, a Hugging Face csapata pedig a saját oldalán már megkezdte a korlátozást és a forenzikus vizsgálatot. A két cég közösen dolgozik az incidens feltárásán. A kihasznált proxyhibát felelősen jelezték a fejlesztőjének, a kutatási infrastruktúrában pedig szigorúbb hozzáférési és megfigyelési szabályok jönnek, még akkor is, ha ez lassítja a kutatást.
Ez nem öntudat, de nem is legyinthető el
A történetből nem az következik, hogy egy modell „akarata ellenére elszabadult”. Az ügynök az elé tett célt hajszolta, és a korlátozások nélküli tesztben olyan megoldásokat talált, amelyekre a készítők nem számítottak. A fontosabb tanulság sokkal prózaibb: ha egy rendszernek hosszú feladatsort, eszközöket és elég mozgásteret adnak, a biztonsági méréshez is úgy kell bánni vele, mintha valódi támadó lenne.