A Google a mai hivatalos bejelentésében három új Gemini-modellt tett közzé: a Gemini 3.6 Flash-t, a 3.5 Flash-Lite-ot és a biztonsági feladatokra hangolt 3.5 Flash Cyber-t. A nagyobb, várva várt Gemini 3.5 Pro viszont továbbra is csak partneri tesztelésben van. A cég közben azt is elmondta, hogy elindította a Gemini 4 eddigi legnagyobb előtanítási futását.
A 3.6 Flashnél most nem a sorszám a lényeg
A Google a Gemini 3.6 Flash-t a korábbi 3.5 Flash közvetlen utódaként kezeli. A fő ígéret nem az, hogy minden feladatban radikálisan okosabb lesz, hanem hogy az ügynöki és kódolási munkákat kevesebb kimeneti tokennel, kevesebb következtetési lépéssel és kevesebb eszközhívással végzi el.
A cég az Artificial Analysis Index alapján 17 százalékkal kevesebb kimeneti tokent említ a 3.5 Flashhez képest. Az ára egymillió bemeneti tokenenként 1,50 dollár, egymillió kimeneti tokenenként pedig 7,50 dollár. Ez utóbbi a fontosabb: aki nem egyetlen kérdésre kér választ, hanem soklépéses ágenseket futtat, annál a kimenet számlája tud igazán elszaladni.

A Google saját méréseiben a 3.6 Flash 49 százalékot ért el a DeepSWE-n a 3.5 Flash 37 százalékával szemben, az OSWorld-Verified eredménye pedig 78,4-ről 83 százalékra nőtt. Ezeket a számokat a helyükön kell kezelni: a cég választotta ki a teszteket és a beállításokat, ezért nem mondják meg előre, hogyan teljesít majd minden saját kódbázison vagy munkafolyamatban. Arra viszont jó jelzések, hogy a Google most kifejezetten a hosszú, eszközt is használó feladatokat próbálja olcsóbban futtathatóvá tenni.
A Flash-Lite azoknak szól, akik sok kis munkát futtatnak
A Gemini 3.5 Flash-Lite a három bejelentésből a legkevésbé látványos név, de valószínűleg sok szolgáltatásban ez dolgozik majd a legtöbbet. Dokumentumfeldolgozásra, ügynöki keresésekre és nagy átviteli igényű automatizmusokra szánja a Google. A hivatalos adat szerint másodpercenként 350 kimeneti tokent tud, az ára pedig egymillió bemeneti tokenenként 0,30, kimeneti tokenenként 2,50 dollár.

Ez nem a „butább chatbot” szerepe. Ha egy rendszer sok száz rövid feladatot oszt szét, például számlákat olvas, adatot címkéz vagy első körben szűri a találatokat, a késleltetés és az egy feladatra eső költség sokszor többet számít, mint az, hogy a modell egyetlen hosszú esszét milyen elegánsan ír meg. A Google erre próbál külön modellt adni, ahelyett hogy mindenre a drágább Flash-t használná.
A Cyber modellt egyelőre nem lehet csak úgy kipróbálni
A Gemini 3.5 Flash Cyber a CodeMender része, és a Google szerint kódsebezhetőségek megkeresésére, ellenőrzésére és javítására hangolták. A hozzáférés kezdetben kormányzatokra és megbízható partnerekre korlátozott pilotban indul. Ez érthető óvatosság, mert egy olyan modell, amely jobban felismeri a sebezhetőségeket, támadási célra is használható lenne.

A Google a CyberGym nevű tesztben versenyképes eredményt mutat a saját modelljére, de ez itt még inkább technológiai helyzetjelentés, mint kész felhasználói termék. A CodeMenderhez kötött modell nem a Gemini app új kapcsolója lesz, hanem korlátozott hozzáférésű biztonsági eszköz.
A Pro késik, a Gemini 4 már fut
A mai hírben éppen az a furcsa, hogy a Google már a negyedik generáció előkészítéséről beszél, miközben a Gemini 3.5 Próból még mindig nincs széles körben elérhető változat. A hivatalos mondat szerint a 3.5 Pro partnerekkel tesztel, és akkor jön, amikor készen áll. Ez nem dátum, hanem ugyanaz a nyitott ajtó, amelyen keresztül korábban is csak ígéretek látszottak.
A 3.6 Flash és a 3.5 Flash-Lite már most elérhető a Gemini alkalmazásban, a fejlesztőknek pedig AI Studio, Gemini API és Android Studio irányából. A Flash-Lite a Google Keresésben is fokozatosan megjelenik. A valódi teszt innen indul: nem az, hogy a Google grafikonja szerint szebb-e egy oszlop, hanem hogy az új modellek tényleg kevesebb hibás módosítást és kevesebb elfolyó tokent hoznak-e a mindennapi munkában.