// ai/mi · 2026.06.08 Történelmi tech-paktum: A Google Gemini alapjaira építve született újjá a Siri a WWDC 2026-on Hivatalosan is kezdetét vette a WWDC 2026, ahol az Apple bejelentette az iOS 27-et, és ezzel együtt végre pontot tett a hónapok óta keringő iparági… olvasás →

A Google videógeneráló modellje, a Gemini Omni Flash újabb frissítést kapott. A The Decoder beszámolója szerint az Omni 1.1 már hosszabb részletekből képes folytatni egy jelenetet, miközben a próbálgatás költségét is lejjebb lehet vinni. A Google hivatalos ismertetője közben azt mutatja meg, mire szánja a cég az Omni családot: többféle bemenetből, köztük képből, hangból és videóból készít, majd szerkeszt mozgóképes tartalmat.

Nem csak az utolsó másodpercre figyel

A videó folytatásánál eddig könnyen előfordult, hogy a modell csak a jelenet legvégét „látta”, ezért a szereplők arca, a háttér vagy a kamera mozgása hirtelen megváltozott. Az Omni 1.1-nél a The Decoder szerint a jelenetkiterjesztés már legfeljebb tíz másodpercnyi korábbi anyagot is elemezhet. Ez nem azt jelenti, hogy egyetlen kattintással kész filmet kapunk, viszont több kapaszkodót ad a modellnek ahhoz, hogy a folytatás ne tűnjön teljesen új felvételnek.

A bővítés tíz másodperces lépésekben kérhető, legfeljebb negyven másodpercig. A fejlesztők emellett legfeljebb három másodperces külső videót is feltölthetnek stílusreferenciának. Így egy rövid klipből átvehető a mozgás ritmusa vagy a karakter viselkedése anélkül, hogy a teljes jelenetet újra kellene építeni. A kezdő- és zárókép megadásával pedig két kulcspont közé kérhető kameramozgás, ami inkább a vágás és a beállítás megtervezését segíti, nem a klasszikus animációs kontrollt váltja ki.

A Gemini Omni videógenerálási funkcióját bemutató hivatalos Google-kép
Forrás: Google

A draft mód a költséget is visszafogja

A frissítés egyik legkézzelfoghatóbb része a 360p-s draft mód. A beszámoló szerint ez a 720p-s kimenethez képest akár hatvan százalékkal gyorsabb, az ára pedig nagyjából a harmada lehet. A The Decoder által közölt API-árak másodpercenként 0,03 dollártól indulnak 360p-n, 720p-n 0,10, 1080p-n 0,15, 4K-ban pedig 0,30 dollár körül alakulnak. Ezek nem előfizetési díjak, hanem a generálásra megadott mennyiségtől függő használati költségek.

A gyors, alacsony felbontású változat elsősorban arra jó, hogy kiderüljön: működik-e a beállítás, jó irányba megy-e a mozgás, és kell-e új prompt. A kész anyag ezután 1080p-re vagy 4K-ra is felskálázható. Ettől azonban még nem lesz azonos egy eleve nagy felbontásban létrehozott videóval: a felskálázás részleteket próbál meg visszaépíteni, ezért a végső minőséget külön érdemes ellenőrizni.

Mit mond a Google saját dokumentációja?

A Google hivatalos bemutatója az Omni Flash-t multimodális modellként írja le, amely képet, hangot, videót és szöveget is kezel, valamint szerkesztési utasításokra is reagál. A cég szerint a cél a jelenetek, a karakterek és a fizikai mozgások következetesebb kezelése; a létrehozott tartalmakat láthatatlan SynthID-jelöléssel is ellátják. Az Omni képességei fokozatosan jelennek meg a Gemini alkalmazásban, a Flowban és a YouTube Shortsban, a fejlesztői hozzáférés pedig az API-kon keresztül érhető el.

Az 1.1-es névvel azért óvatosan

Van egy fontos különbség a frissítésről szóló hírek és a Google nyilvános dokumentációja között. A The Decoder Omni 1.1-ként hivatkozik az új képességekre, a Google fejlesztői oldalain viszont továbbra is a gemini-omni-flash-preview modellnév szerepel. Ez nem cáfolja a változásokat, csak azt jelzi, hogy az 1.1-es elnevezés jelenleg inkább a frissített funkciócsomag rövid neve, nem egy minden felületen külön kiadott, végleges API-verzió.

A gyakorlati tanulság így egyszerű: a rövid drafttal olcsóbban lehet ötletelni, a hosszabb kontextus pedig javíthatja a folytonosságot. Aki publikálható videót készít, annak továbbra is számolnia kell a felskálázás minőségi korlátaival, az API árakkal és azzal, hogy a végleges modellnév még nem egységes minden Google-felületen.