// ai/mi · 2026.09.02 Google Pics: AI-alapú képgenerálót és képszerkesztőt kapott a Google Workspace Közvetlen képgeneráló és képmanipulációs motorral bővült a Google Workspace felhős irodai csomag: a vállalat a hivatalos közleményében leplezte le a Google Pics nevű eszközt. A… olvasás →

Hivatalosan is leplezte legújabb áttörését a mesterséges intelligencia kutatásának egyik legismertebb alakja, Fei-Fei Li által alapított startup: a World Labs Atlas névre keresztelt omni-világmodellje mindössze néhány hétköznapi fotóból képes teljes, bejárható és fizikailag szimulálható háromdimenziós tereket generálni.

Térbeli intelligencia: nem sík videó, hanem valódi 3D világ

A kutatócsapat megközelítése alapvetően szakít a mai népszerű videógenerátorok (például a Sora vagy a Runway) működési elvével. Míg a hagyományos modellek csupán kétdimenziós pixelhalmazként kezelik a világot, a World Labs Atlas minden bemeneti képpontot konkrét térbeli koordinátákhoz rögzít. Ez a megközelítés lehetővé teszi, hogy a felhasználó szabadon megválasztott kameramozgással, tetszőleges szögből és magasságból járja be a generált helyszínt anélkül, hogy a látvány eltorzulna vagy a tárgyak elmosódnának.

A rendszer nem csupán kész videókat renderel, hanem natív 3D formátumokba – többek között pontfelhőkbe (point cloud) és háromdimenziós Gauss-foltokba (3D Gaussian Splats) – exportálja a felépített tereket. Egyetlen utcaszintű fotóból kiindulva az algoritmus képes felmérni a geometriai mélységet, és olyan madártávlati vagy dinamikus kameraszögeket generálni, amelyeket a valóságban csak drónokkal vagy speciális filmes darukkal lehetne rögzíteni.

A World Labs Atlas modell által generált 3D pontfelhő és kameramozgási útvonal
Forrás: World Labs

Hogyan segíti a World Labs Atlas a robotok betanítását?

A technológia legnagyobb gyakorlati haszonélvezője a robotika területe lehet. A fejlesztők által bemutatott valóságból-szimulációba (real-to-sim) munkafolyamat során a World Labs Atlas néhány szobafotó alapján felépíti a helyiség pontos digitális mását. Ebben a virtuális tesztkörnyezetben a mérnökök tetszőlegesen változtathatják a fényviszonyokat, áthelyezhetik a bútorokat vagy kicserélhetik a megfogandó tárgyakat, felgyorsítva az autonóm gépek felkészítését.

A technológia hátterében a kutatócsapat által korábban felvásárolt SceniX startup tapasztalatai állnak: a kifejlesztett szimulációs motor egyetlen valós feladatból több ezer virtuális variációt képes létrehozni a vezérlőmodellek betanításához. A tesztek során öt különböző robotikai platformon futtatták sikeresen a betanított modelleket, amelyek több mint egy órán keresztül működtek hibátlanul emberi beavatkozás nélkül a szimulációból átültetett környezetben.

Architekturális szempontból a modell az autoregresszív nyelvi modellek lépésenkénti logikáját és memóriakezelését kombinálja a videós diffúziós eljárásokkal: a képpontok zajból történő fokozatos felépítése mellett a térbeli mélység és az időbeli folytonosság párhuzamosan számolódik, így a kamera hirtelen elfordulásakor sem esik szét a geometria.

Bár a rendszer egyelőre csak szűk körű partneri hozzáféréssel érhető el, a World Labs Atlas által képviselt térbeli megközelítés hidat képez a vizuális tartalomgyártás és a fizikai világot értelmező mesterséges intelligencia között, megnyitva az utat a sokkal önállóbb és adaptívabb robotikai rendszerek előtt.