// ai/mi · 2026.09.03 Egyetlen fotóból épít szimulált 3D világot a World Labs Atlas modellje Hivatalosan is leplezte legújabb áttörését a mesterséges intelligencia kutatásának egyik legismertebb alakja, Fei-Fei Li által alapított startup: a World Labs Atlas névre keresztelt omni-világmodellje mindössze… olvasás →

Megjelent a nyílt forráskódú helyi nyelvi modell futtató ökoszisztéma legújabb kiadása: az Ollama v0.33.3 fontos mérföldkövet jelent a lokálisan futtatott gépi tanulási modellek világában, megnyitva az utat a fejlett multimodális feladatok előtt az Apple hardverein.

Multimodális kép- és hangfeldolgozás az Apple MLX motoron

A verzió legkiemelkedőbb fejlesztése a Google DeepMind nyílt súlyú Gemma 4 modellcsaládjának kibővített támogatása: az új kiadástól kezdve a felhasználók már képeket és hangfájlokat is közvetlenül feldolgozhatnak a Gemma 4 segítségével az Apple Silicon natív MLX keretrendszerén. Ez azt jelenti, hogy az M-sorozatú chipekkel szerelt Mac számítógépeken a multimodális elemzés felhős előfizetés és API-kulcsok nélkül, teljesen privát környezetben zajlik, közvetlenül az egyesített memóriát (Unified Memory) kihasználva.

Az Ollama projekt hivatalos lámát ábrázoló logója
Forrás: Ollama

A helyi multimodális képességek révén a fejlesztők vizuális dokumentumelemzést, képaláírás-generálást és közvetlen hangalapú asszisztensfunkciókat építhetnek fel minimális késleltetéssel, miközben az érzékeny adatok soha nem hagyják el a helyi munkaállomást.

A Gemma 4 architektúra különlegessége, hogy a látás- és hangfeldolgozó enkódereket közvetlenül a neurális hálóba integrálták, így nincs szükség külső beszédfelismerő (például különálló Whisper) vagy vizuális modellek körülményes láncolására. A 4 bites és 8 bites kvantálási eljárásoknak köszönhetően a modell még a belépőszintű, 16 GB egyesített memóriával felszerelt Apple gépeken is nagy sebességű token-generálásra képes az MLX hardveres gyorsítójával.

Gyorsítótárazott tokenek jelentése az Ollama v0.33.3 verziójában

Az új kiadás a fejlesztői munkafolyamatok pontosabb felügyeletét is megkönnyíti: az Ollama v0.33.3 mostantól részletes statisztikát közöl a válaszokban a gyorsítótárból kiszolgált prompt-tokenekről (cached prompt tokens). Ez az információ kulcsfontosságú az összetett kódolási asszisztensek és autonóm szoftverfejlesztő ágensek építésekor, hiszen a gyorsítótárazott kontextus jelentősen felgyorsítja a válaszidőt és mérsékli az energiafogyasztást.

A frissítés emellett javítja a GGUF formátumú modellek kezelését is: a motor mostantól szigorúan tiszteletben tartja a modellfájlokban definiált gyári alapértelmezett paramétereket, megelőzve a kéretlen hallucinációkat vagy a kontextusméret téves beállítását. A motorháztető alatt a legfrissebb upstream llama.cpp, MLX és MLX-C komponensek gondoskodnak a stabilitásról és a hibátlan hardveres gyorsításról.

A gyakorlati használat rendkívül egyszerű maradt: a felhasználók a megszokott módon, a parancssorból egyetlen paranccsal elindíthatják a modellt, a vizuális vagy audió állományokat pedig egyszerűen a terminálba húzva vagy elérési útvonalként megadva fűzhetik a promptokhoz. A fejlesztői közösség számára ez hatalmas előrelépést jelent a költséges felhős API-függőségek felszámolásában.

A frissítés már letölthető az Ollama hivatalos GitHub felületéről és a beépített parancssori frissítőn keresztül Linux, macOS és Windows operációs rendszerekre egyaránt, a meglévő telepítések pedig a terminálból kiadott gyors frissítési parancs futtatásával pillanatok alatt naprakésszé tehetők.