A nagy nyelvi modellek tanításához használt automatizált adatgyűjtési architektúrák közvetlenül kikerülik a kiadói fizetőfalakat és a digitális szerzői jogi azonosítókat. A The Seattle Times és a Newsday által az SDNY bíróságon benyújtott szövetségi perirat (1:26-cv-07644) adatai szerint az OpenAI és a Microsoft engedély és anyagi ellentételezés nélkül emelte be a GPT-modellcsalád és a Copilot tanító adatkészleteibe a lapok előfizetéses tartalmait.
Fizetőfal-kerülés, metaadat-eltávolítás és hallucinációs hibaattribúció
A benyújtott bírósági kereset négy konkrét technikai és piaci mechanizmust rögzít:
- Fizetőfal-kerülő adatgyűjtés: A technológiai rendszerek automatizált robotjai kikerülték a kiadói beléptetőrendszereket, és a regisztrációhoz kötött, előfizetéses tartalmakat közvetlenül a tanító adatbázisokba táplálták.
- Szerzői jogi metaadatok törlése: A Digital Millennium Copyright Act (DMCA) 1202-es cikkelyét megsértve a tanítási korpuszok előfeldolgozása során szisztematikusan eltávolították a cikkek címeit, a szerzők neveit és a kiadói jogvédelmi azonosítókat (CMI).
- Hallucinációk forrásattribúcióval: A perirat tesztpromptokkal dokumentálja, hogy a nyelvi modellek koholt tényeket generáltak, amelyeket forrásként valótlanul a The Seattle Times és a Newsday tényfeltáró anyagainak tulajdonítottak.
- Közvetlen piaci helyettesítés: A keresőfelületekbe épített generatív válaszmodulok szintetizálják a sajtóanyagokat, így a felhasználók nem látogatnak el az eredeti forrásoldalakra, elvágva a digitális előfizetési és hirdetési forgalmat.

Az adatkészletek és a modellsúlyok megsemmisítésének követelése
A kiadók a törvényes kártérítésen (statutory damages) túl technikai szankciót kérnek: a jogosulatlanul lemásolt cikkek, az azokat tartalmazó tanító adatbázisok, valamint a védett adatokon kiképzett mesterségesintelligencia-modellsúlyok bírósági megsemmisítését követelik.
Az alperesi védekezés a 17 U.S.C. § 107 szerinti méltányos használat (fair use) doktrínájára támaszkodik: az OpenAI álláspontja szerint az internetes adatok statisztikai feldolgozása átalakító jellegű (transformative) folyamat. A Microsoft képviselői jelezték, hogy nyitottak a helyi újságírás támogatását szolgáló egyeztetésekre.
A szerzői jogi konfliktus a transzformatív tanulási érvelés és az adathalmazokból végrehajtott szándékos metaadat-eltávolítás technikai bizonyíthatóságának egyensúlyán dől el.