A Meta AI Research augusztus 10-i bejelentése szerint a Muse Glimmer egy 30 milliárd paraméteres, nyílt súlyozású modell, amelyet kifejezetten mindig elérhető, helyben futó AI-ügynökökhöz terveztek. A Meta nem egyszerű chatbotként pozicionálja, hanem olyan modellként, amely hosszabb feladatláncokat tud végigvinni: eszközöket hív meg, hibát kezel, több lépésen át tervez, kódot ír, és képes képet meg szöveget együtt értelmezni.

A Meta Apache 2.0 licenc alatt adja ki a súlyokat, és rögtön azzal próbálja megkülönböztetni a Glimmert a nagy felhős modellektől, hogy egyetlen fogyasztói GPU-val szerelt Macen vagy PC-n is futtatható legyen. A cég szerint ez a kategória akkor érdekes igazán, ha az ügynök személyes kontextushoz is hozzáfér: naptárt kezel, fájlokat rendez, üzeneteket fogalmaz, vagyis olyan munkát csinál, ahol sokat számít, hogy az adatoknak ne kelljen állandóan felhőbe utazniuk.

Hogyan építették fel?

A Meta leírása alapján a Muse Glimmer egy többlépcsős tréningfolyamat eredménye. Az előtanításnál a nagyobb Muse Spark modell kimeneteit használták logit distillationnel, vagyis a kisebb modellt részben egy erősebb tanármodell viselkedésére húzták rá. Ezt követte egy köztes szakasz hosszabb kontextusú, erősen ügynöki feladatokkal és részletesebb reasoning nyomokkal, majd a végén jött a finomhangolás felügyelt tanítással, on-policy distillationnel és megerősítéses tanulással. A Meta külön kiemeli, hogy a modellt általános, reasoning, kódolási és agentic területeken hangolták tovább.

Funkciók szintjén a Muse Glimmer több fontos képességet egyszerre próbál összehozni. A cég szerint jól teljesít teljes feladatos agent benchmarkokon, például DeepSearch QA-n, MCP-Atlason, τ-Bench-en és SWE-Bench-en. Emellett támogatja a pontos eszközhívást, a több lépéses következtetést, a hibák utáni újrapróbálkozást, a multimodális bemenetet és a különféle scaffoldokkal való együttműködést. A Meta azt is írja, hogy a modellt több mint 100 nyelv adatain tréningezték.

Mit jelent a helyi futás a gyakorlatban?

Az egyik legfontosabb konkrét adat a memóriaigény. A Meta szerint teljes pontosságon egy 30 milliárd paraméteres modell több mint 55 GB memóriát kérne, ami már bőven túl van a tipikus gamer és fejlesztői gépek lehetőségein. Ezért kvantálással körülbelül 4 bites precizitásra szorították le a súlyokat, így a nyelvi rész 20 GB alá kerülhet. A cég állítása szerint így marad hely a KV cache-nek, a képfeldolgozó encodernek és a spekulatív dekódolást végző kísérőmodellnek is, vagyis a teljes futás 24 vagy 32 GB-os memóriakeretben is megoldható.

A gyorsítás másik kulcsa a DFlash-alapú drafter modell. Ez nem a végső választ írja meg önállóan, hanem előre javasol tokenblokkokat, amelyeket a fő modell párhuzamosan ellenőriz. A Meta szerint ettől a minőség nem romlik, a dekódolás viszont érezhetően felgyorsul. A bemutatóban közölt mérés alapján az RTX 5090-en 3,1-szeres, az M5 Maxon 1,8-szoros, az M4 Maxon pedig 1,5-szeres gyorsulást mértek a hagyományos tokenenkénti generáláshoz képest.

Mivel lehet használni?

A Meta szerint a Hugging Face-re már felkerültek a súlyok, a dokumentáció is elérhető, és a következő napokban jönnek az optimalizált integrációk több ismert helyi vagy edge-eszközhöz. A cég név szerint említi a llama.cpp-t, az MLX-et és az ExecuTorchot, helyi futtatásnál pedig az Ollamát, az LM Studiót és az Unslothot. Kiszolgálási oldalról a vLLM és az SGLang szerepel, a gyors induláshoz pedig olyan partnereket sorolnak, mint a Together AI, a Fireworks AI és az OpenRouter. Emellett külön optimalizálást ígérnek AMD, Arm, Dell, Intel és NVIDIA eszközökre is.

A lényeg így már jóval világosabb: a Muse Glimmer nem azért érdekes, mert a Meta kiadott még egy nyílt modellt, hanem azért, mert ezt kifejezetten a helyben futó, folyamatosan dolgozó AI-ügynökök világára hangolták. A 30B-s méret, a 4 bites kvantálás, a 24-32 GB-os célhardver, a multimodális bemenet és a DFlash gyorsítás együtt már egy egészen konkrét fejlesztői csomagot rajzol ki, nem csak egy hangzatos kutatási bejelentést.