Két új generatív képi modellt tett elérhetővé az OpenAI a ChatGPT Images 2.5 frissítés részeként. A The Decoder beszámolója szerint a GPT-Image-2.5 Flare a gyorsabb válaszidőre és az alacsonyabb számítási késleltetésre koncentrál, míg a robusztusabb GPT-Image-2.5 Sunburst az iteratív, képrészlet-szintű szerkesztési feladatokra optimalizált csúcsváltozat. A fejlesztések a fogyasztói ChatGPT felületén, a vállalati ChatGPT Work munkakörnyezetben és a fejlesztői API-n keresztül is élesedtek.
Flare és Sunburst: sebesség a precizitás ellenében
Az OpenAI adatai alapján a felhasználók hetente több mint hárommilliárd képet generálnak a platformon. A terhelés kezelésére a vállalat szétválasztotta a generálási útvonalakat. A Flare verzió a korábbi GPT-Image-2-höz képest akár 50 százalékkal alacsonyabb inferencia-késleltetést biztosít jobb felületi textúrák és természetesebb megvilágítás mellett. Ezzel szemben a Sunburst változat hosszabb következtetési (reasoning) időt vesz igénybe, ám az egymást követő szerkesztési körökben képes kizárólag a módosítani kért elemeket átrajzolni anélkül, hogy a kompozíció többi részét akaratlanul megváltoztatná.
A fejlesztői API-ban mindkét modellhez azonos tokenárak tartoznak: 8 dollár 1 millió bemeneti képtokenért és 30 dollár 1 millió kimeneti képtokenért. Az egy képre eső tényleges költség azonban eltér, mivel az Images 2.5 bevezette az új „xhigh” és „max” minőségi szinteket. Egy 1024×1024 pixeles kép a „low” szinten mintegy 0,006 dollárba, „high” beállításon 0,053 dollárba, míg a „max” szinten nagyjából 0,21 dollárba kerül. A Sunburst az összetettebb belső gondolkodási láncok miatt magasabb kimeneti tokenszámot generál, így a gyakorlatban drágább a futtatása.

Sketch funkció, sablonok és DeepMind SynthID vízjelezés
A felhasználói felületen megjelent a Sketch funkció, amelyet a felhasználók a „@Sketch” paranccsal hívhatnak elő. Ez lehetővé teszi, hogy közvetlenül a chatablakban vázoljanak fel formákat, alaprajzokat vagy durva körvonalakat, amelyeket a modell bemeneti elrendezési sablonként használ fel a végleges illusztráció kidolgozásához. Ezt egészítik ki az előre definiált szerkezeti sablonok logókhoz, infografikákhoz és hirdetési anyagokhoz.
Az eredetvédelem és a mesterséges képek azonosítása terén az OpenAI többrétegű megoldást alkalmaz. A metaadatok szintjén a C2PA iparági szabvány rögzíti a generálás adatait, míg a képpontok szintjén a Google DeepMind által fejlesztett, szemmel láthatatlan SynthID digitális vízjelet ágyazzák be, amely a képek utólagos átméretezése vagy tömörítése után is kimutatható marad.
| Tulajdonság | GPT-Image-2.5 Flare | GPT-Image-2.5 Sunburst |
|---|---|---|
| Fő fókusz | Alacsony késleltetés, gyors vázlatkészítés | Iteratív, precíz képrészlet-szerkesztés |
| Relatív késleltetés | ~50%-kal gyorsabb a v2-nél | Hosszabb belső levezetési idő |
| Arena pontszám (LMSYS) | 1399 pont (2. hely) | 1421 pont (1. hely) |
| Minőségi szintek | low, medium, high, xhigh, max | low, medium, high, xhigh, max |
| Bemeneti / Kimeneti tokenár | $8 / $30 per millió token | $8 / $30 per millió token |
| Eredetvédelem | C2PA metaadat + SynthID vízjel | C2PA metaadat + SynthID vízjel |
Eredmények a szöveg-kép benchmarkokon
Az LMSYS Text-to-Image Arena ranglistáján az új modellek az első két helyet foglalták el az előzetes szavazatok alapján: a Sunburst 1421 ponttal vezeti az összesítést, míg a Flare 1399 ponttal áll a második helyen, megelőzve a korábbi GPT-Image-2-t (1381 pont), valamint a Microsoft mai-image-2.6 és a Grok Imagine 2.0 rendszereit.
A kettős architektúra bevezetése azt a szerkezeti kompromisszumot igyekszik feloldani, amely a tömeges, alacsony késleltetésű csevegési igények és a professzionális, szigorú elrendezést követelő szerkesztési feladatok között feszül a generatív képalkotó munkafolyamatokban.