Megjelent a nyílt forráskódú helyi nyelvi modell futtató ökoszisztéma legújabb kiadása: az Ollama v0.33.3 fontos mérföldkövet jelent a lokálisan futtatott gépi tanulási modellek világában, megnyitva az utat a fejlett multimodális feladatok előtt az Apple hardverein.
Multimodális kép- és hangfeldolgozás az Apple MLX motoron
A verzió legkiemelkedőbb fejlesztése a Google DeepMind nyílt súlyú Gemma 4 modellcsaládjának kibővített támogatása: az új kiadástól kezdve a felhasználók már képeket és hangfájlokat is közvetlenül feldolgozhatnak a Gemma 4 segítségével az Apple Silicon natív MLX keretrendszerén. Ez azt jelenti, hogy az M-sorozatú chipekkel szerelt Mac számítógépeken a multimodális elemzés felhős előfizetés és API-kulcsok nélkül, teljesen privát környezetben zajlik, közvetlenül az egyesített memóriát (Unified Memory) kihasználva.

A helyi multimodális képességek révén a fejlesztők vizuális dokumentumelemzést, képaláírás-generálást és közvetlen hangalapú asszisztensfunkciókat építhetnek fel minimális késleltetéssel, miközben az érzékeny adatok soha nem hagyják el a helyi munkaállomást.
A Gemma 4 architektúra különlegessége, hogy a látás- és hangfeldolgozó enkódereket közvetlenül a neurális hálóba integrálták, így nincs szükség külső beszédfelismerő (például különálló Whisper) vagy vizuális modellek körülményes láncolására. A 4 bites és 8 bites kvantálási eljárásoknak köszönhetően a modell még a belépőszintű, 16 GB egyesített memóriával felszerelt Apple gépeken is nagy sebességű token-generálásra képes az MLX hardveres gyorsítójával.
Gyorsítótárazott tokenek jelentése az Ollama v0.33.3 verziójában
Az új kiadás a fejlesztői munkafolyamatok pontosabb felügyeletét is megkönnyíti: az Ollama v0.33.3 mostantól részletes statisztikát közöl a válaszokban a gyorsítótárból kiszolgált prompt-tokenekről (cached prompt tokens). Ez az információ kulcsfontosságú az összetett kódolási asszisztensek és autonóm szoftverfejlesztő ágensek építésekor, hiszen a gyorsítótárazott kontextus jelentősen felgyorsítja a válaszidőt és mérsékli az energiafogyasztást.
A frissítés emellett javítja a GGUF formátumú modellek kezelését is: a motor mostantól szigorúan tiszteletben tartja a modellfájlokban definiált gyári alapértelmezett paramétereket, megelőzve a kéretlen hallucinációkat vagy a kontextusméret téves beállítását. A motorháztető alatt a legfrissebb upstream llama.cpp, MLX és MLX-C komponensek gondoskodnak a stabilitásról és a hibátlan hardveres gyorsításról.
A gyakorlati használat rendkívül egyszerű maradt: a felhasználók a megszokott módon, a parancssorból egyetlen paranccsal elindíthatják a modellt, a vizuális vagy audió állományokat pedig egyszerűen a terminálba húzva vagy elérési útvonalként megadva fűzhetik a promptokhoz. A fejlesztői közösség számára ez hatalmas előrelépést jelent a költséges felhős API-függőségek felszámolásában.
A frissítés már letölthető az Ollama hivatalos GitHub felületéről és a beépített parancssori frissítőn keresztül Linux, macOS és Windows operációs rendszerekre egyaránt, a meglévő telepítések pedig a terminálból kiadott gyors frissítési parancs futtatásával pillanatok alatt naprakésszé tehetők.