Kötelezővé teszi a géppel generált szövegek gépi olvasható jelölését az Európai Unió mesterséges intelligenciáról szóló rendelete: az OpenAI hivatalosan közzétette a textGrain elnevezésű, láthatatlan szövegvízjelezési eljárását. A kutatócég által közzétett technikai kutatási jelentés értelmében a technológia az Európai Unió területén működő ChatGPT és Codex felhasználók kimeneteiben jelenik meg automatikusan az elkövetkező hetekben. A szoftverfejlesztők globális API-hozzáférésében opcionális, alapértelmezetten kikapcsolt funkcióként válik elérhetővé az új jelölési mechanizmus.
Hogyan működik a textGrain statisztikai vízjel?
A korábbi kísérleti megoldások gyakran speciális, láthatatlan karaktereket vagy szóközöket helyeztek el a karakterláncokban, amelyeket egy egyszerű szűrővel azonnal el lehetett távolítani. A textGrain ezzel szemben közvetlenül a nyelvi modellek matematikai mintavételezési logikájába avatkozik be. A módszer a Gumbel-eloszláson alapuló véletlenszerűséget és a Kullback–Leibler (KL) regularizációval szabályozott optimális transzport feladatot (optimal transport problem) alkalmazza a tokenek kiválasztásakor.
A generálás során a modell egy titkos kriptográfiai kulcs segítségével finoman eltolja a valószínűségi súlyokat azok felé a szavak felé, amelyek a kulcshoz rendelt pszeudovéletlen eloszlást erősítik. Az emberi olvasó számára a mondatok nyelvtani szerkezete, természetessége és jelentése változatlan marad. A titkos kulccsal felvértezett detektor szoftver viszont statisztikai tesztekkel képes kimutatni ezeket a halmozott valószínűségi eltéréseket a szövegrészletekben.

Megbízhatóság és felismerési arányok
A fejlesztők közzétett mérései szerint a textGrain megbízhatósága egyenes arányban növekszik a szöveg hosszával. Egy 200 tokenes, hozzávetőleg 150 szóból álló bekezdésnél 80 százalékos, míg egy 400 tokenes szövegrészletnél már 95 százalékos pontossággal azonosítható a rejtett vízjel jelenléte. A mérési jegyzőkönyv szerint ez a pontosság mindössze 1 százalékos téves riasztási arány (False Positive Rate) mellett tartható fenn, ami a kísérleti tesztekben felülmúlja a Google-féle SynthID szöveges változatának eredményeit.
A technológia hatékonysága a nyelvi rugalmasság csökkenésével párhuzamosan meredeken visszaesik. A kötött formátumú matematikai levezetések, pontos számítási képletek vagy szigorú szintaxisú programozási kódok minimális tokenválasztási szabadságot engednek meg a modellnek. Ilyen környezetben a statisztikai jel elveszíti az erejét, és a detektor nem tud megbízható ítéletet hozni a forrásról.
A vízjel korlátai és az elfedési kísérletek
A közzétett dokumentáció részletesen kitér a módszer technikai határaira is. A statisztikai ujjlenyomat érzékenyen reagál az utólagos módosításokra: a szavak mindössze 25 százalékának szinonimára cserélése 17 százalékra csökkenti a sikeres azonosítás esélyét. Egy másik nyelvre történő gépi vagy kézi fordítás, illetve a mondatok alapos átfogalmazása teljesen megsemmisítheti a mintázatot.
A vízjel nem tartalmaz semmilyen személyes profildatot, fiókazonosítót, IP-címet vagy felhasználói utasítás-előzményt. A fejlesztők külön hangsúlyozzák a bizonyossági szintek aszimmetriáját: a vízjel hiánya nem igazolja az emberi szerzőséget, míg a vízjel megléte önmagában nem garantálja a szöveg ténybeli helyességét vagy a módosításmentességet.
Zárt hozzáférésű detektor és többdimenziós védelem
A vízjel azonosítására szolgáló detektort az OpenAI egyelőre zárt körben tartja. A hozzáférést akkreditált kutatóintézetek és szakmai partnerszervezetek kaphatják meg külön elbírálás alapján, megakadályozva a célzott kijátszási technikák ipari méretű tesztelését. A tervek szerint a technológiát a jövőben nyílt forráskódúvá kívánják tenni.
A szöveges jelölés egy rétegzett eredetvédelmi architektúra eleme, amely a hangkimeneteknél a SynthID jelölést, a képi állományoknál pedig a C2PA metaadatokat alkalmazza. A gépi és emberi alkotások jogi szétválasztása globális szinten kiemelt jelentőségű, ami korábban a vuhani bíróság AI szerzői jogi döntésében is központi szerepet játszott. A statisztikai mintavételezés finomhangolása az első közvetlen mérnöki lépés a szigorodó európai jogszabályi megfelelés biztosítására.