A South China Morning Post beszámolója szerint Kína AI-versenyének következő nagy akadálya nem feltétlenül egy újabb chipkorlátozás lehet. A kínai nyelvű, jó minőségű tanítóadatok szűkössége egyre több fejlesztőt aggaszt, miközben az ország saját modellekkel próbálja ledolgozni a hardveres hátrányt.
A chiphiány látványos, az adatválság kevésbé
Az amerikai exportkorlátozások miatt Kínának régóta nehezebb hozzáférnie a legfejlettebb AI-gyorsítókhoz. Erre válaszul a helyi cégek hatékonyabb modelleket, saját gyorsítókat és nyílt súlyú rendszereket fejlesztenek. Egy modell betanításához azonban nem elég a számítási kapacitás: megfelelő, változatos és jogilag is használható adatokra van szükség.
A kínai nyelvű webes tartalom mennyisége önmagában nem jelenti azt, hogy elegendő jó tanítóanyag áll rendelkezésre. A duplikált, géppel generált, reklámokkal teli vagy politikailag torzított szövegek kevésbé alkalmasak arra, hogy egy modell megbízható tudást tanuljon belőlük. A fejlesztőknek egyre többet kell szűrniük, címkézniük és ellenőrizniük.
A saját nyelv nem automatikusan saját adatbázis
A kínai cégeknek ráadásul nem csupán általános webszövegekre van szükségük. A jó modellekhez tudományos, műszaki, egészségügyi, oktatási és üzleti anyagok kellenek, lehetőleg olyan formában, amelyben a szerzői jog és a személyes adatok kezelése is tisztázható. Ezekből jóval kevesebb van, mint rövid közösségi posztokból vagy újrahasznosított hírekből.
A helyzetet tovább nehezíti, hogy a legújabb modellek egy része már maga is szintetikus adatokat termel. Ez olcsó és gyors megoldásnak tűnik, de ha a generált szövegek korábbi generált szövegekből készülnek, a hibák és az egyoldalú minták könnyen körbeérnek. A mennyiség így nőhet, a valódi információérték viszont nem feltétlenül.
A következő csata a hozzáférésről szólhat
Kína számára ezért stratégiai kérdéssé válhat, ki fér hozzá a jó minőségű nemzeti adatvagyonhoz. Az állami szervek, a nagy platformok és a kutatóintézetek egyaránt szeretnék felhasználni a saját archívumaikat, de az adatmegosztásnál jogi, adatvédelmi és üzleti korlátok jelennek meg.
A történet tanulsága nem az, hogy Kína leállna az AI-fejlesztéssel. Inkább az, hogy a chip- és energiaigény után az adat minősége válhat a következő szűk keresztmetszetté. Aki gyorsabb modelleket akar építeni, annak nemcsak több GPU-ra, hanem jobb és tisztább tanítóanyagra is szüksége lesz.