A MiniMax közzétette a H3 videómodell súlyait és részletes modellkártyáját. Az Artificial Analysis vaktesztes rangsorában a H3 most első videószerkesztésben, miközben szövegből és képből készített videóknál is az élmezőnyben van. A helyben futtatható kiadásból azonban két lényeges elem hiányzik: a 2K-s újrageneráló modul és a bonyolult bemeneteket feldolgozó H3-Context-IR.

// ai/mi · 2026.07.16 A Kimi K3 nagyot lép, de az olcsó kínai AI régi képe közben kopik A Kimi K3 hivatalosan 2,8 billió paraméteres modell, 1M tokenes kontextussal és natív képi megértéssel. A kérdés már nem csak az, mennyire erős, hanem az… olvasás →

Egy modell kezeli a képet, a videót és a hangot

A H3 egy 33 milliárd paraméteres, sűrű transzformerre épül. Szöveget, képet, videót és hangot egyetlen multimodális környezetként kezel, majd legfeljebb 15 másodperces videót készít sztereó hanggal. A rendszer 24 képkockát generál másodpercenként, a hang mintavételezése 32 kHz.

A bemenet jóval több lehet egy rövid szöveges utasításnál. A referenciaalapú változat legfeljebb kilenc képet, három rövid videót és három hangfájlt fogad. A videók és hangok együttes hossza kategóriánként legfeljebb 15 másodperc lehet, a fájlok teljes száma pedig nem haladhatja meg a tizenkettőt.

A MiniMax H3 három fő részét bemutató hivatalos rendszerábra
Forrás: MiniMax

A MiniMax tizenegy nyelvnél ígér stabil beszédtámogatást. Ezek között ott van az angol, a kínai, a német, a francia, a japán és a koreai, a magyar viszont nem szerepel a felsorolásban. Ettől még a modell próbálkozhat magyar szöveggel, csak éppen a fejlesztő nem vállal ugyanolyan megbízhatóságot.

A 2K-s eredményhez továbbra is kell a MiniMax szolgáltatása

A nyílt kiadás alapmodellje 768 pixeles rövidebb oldallal készíti el a videót. A hivatalos rendszer ezután ugyanazzal a modellel, az eredeti utasításokat is felhasználva újragenerálja az eredményt 2K-ban. Ennek a H3-Regenerate-2K nevű modulnak a kódját és súlyait egyelőre nem tették közzé; a MiniMax későbbi kiadást ígér, addig az API használható.

Hasonló a helyzet a H3-Context-IR-rel. Ez értelmezi, hogyan kapcsolódnak egymáshoz a feltöltött képek, videók, hangok és a szöveges utasítások, majd rendezett leírást készít az alapmodellnek. A vállalat szerint ettől is függ a végső minőség, mégsem része a letölthető csomagnak. A helyi felhasználónak saját előfeldolgozást kell építenie, vagy a MiniMax API-jára kell támaszkodnia.

Az „open weights” megjelölés tehát jogos az alapmodellre, de nem jelenti azt, hogy a felhőben bemutatott teljes munkafolyamat minden darabja szabadon futtatható. A licenc sem korlátlan: ha a H3-ra épülő kereskedelmi termék vagy szolgáltatás éves bevétele meghaladja a 20 millió dollárt, külön írásos engedély kell a MiniMaxtól. A felületen a modell nevét is fel kell tüntetni.

A ranglista erős eredményt mutat, nem végleges ítéletet

Az Artificial Analysis videós arénája névtelen párokban mutatja meg a modellek eredményeit, a felhasználók pedig kiválasztják a jobbat. A videószerkesztési, hangot is figyelembe vevő listán a H3 most 1130-as Elo-ponttal vezet. Szövegből videó készítésében második, képből videó készítésében harmadik.

Ezek a helyezések a további szavazatokkal változhatnak, és nem mérnek minden gyakorlati szempontot. Nem derül ki belőlük például, milyen hardver kell a helyi futtatáshoz, mennyire következetes a modell hosszabb munkában, vagy mennyi kézi javítást kér egy valódi produkcióban. A H3 ettől még ritka helyzetet teremtett: letölthető súlyú modell került egy olyan összesített videós lista élére, amelyet eddig jellemzően zárt szolgáltatások uraltak.