A MiniMax közzétette a H3 videómodell súlyait és részletes modellkártyáját. Az Artificial Analysis vaktesztes rangsorában a H3 most első videószerkesztésben, miközben szövegből és képből készített videóknál is az élmezőnyben van. A helyben futtatható kiadásból azonban két lényeges elem hiányzik: a 2K-s újrageneráló modul és a bonyolult bemeneteket feldolgozó H3-Context-IR.
Egy modell kezeli a képet, a videót és a hangot
A H3 egy 33 milliárd paraméteres, sűrű transzformerre épül. Szöveget, képet, videót és hangot egyetlen multimodális környezetként kezel, majd legfeljebb 15 másodperces videót készít sztereó hanggal. A rendszer 24 képkockát generál másodpercenként, a hang mintavételezése 32 kHz.
A bemenet jóval több lehet egy rövid szöveges utasításnál. A referenciaalapú változat legfeljebb kilenc képet, három rövid videót és három hangfájlt fogad. A videók és hangok együttes hossza kategóriánként legfeljebb 15 másodperc lehet, a fájlok teljes száma pedig nem haladhatja meg a tizenkettőt.

A MiniMax tizenegy nyelvnél ígér stabil beszédtámogatást. Ezek között ott van az angol, a kínai, a német, a francia, a japán és a koreai, a magyar viszont nem szerepel a felsorolásban. Ettől még a modell próbálkozhat magyar szöveggel, csak éppen a fejlesztő nem vállal ugyanolyan megbízhatóságot.
A 2K-s eredményhez továbbra is kell a MiniMax szolgáltatása
A nyílt kiadás alapmodellje 768 pixeles rövidebb oldallal készíti el a videót. A hivatalos rendszer ezután ugyanazzal a modellel, az eredeti utasításokat is felhasználva újragenerálja az eredményt 2K-ban. Ennek a H3-Regenerate-2K nevű modulnak a kódját és súlyait egyelőre nem tették közzé; a MiniMax későbbi kiadást ígér, addig az API használható.
Hasonló a helyzet a H3-Context-IR-rel. Ez értelmezi, hogyan kapcsolódnak egymáshoz a feltöltött képek, videók, hangok és a szöveges utasítások, majd rendezett leírást készít az alapmodellnek. A vállalat szerint ettől is függ a végső minőség, mégsem része a letölthető csomagnak. A helyi felhasználónak saját előfeldolgozást kell építenie, vagy a MiniMax API-jára kell támaszkodnia.
Az „open weights” megjelölés tehát jogos az alapmodellre, de nem jelenti azt, hogy a felhőben bemutatott teljes munkafolyamat minden darabja szabadon futtatható. A licenc sem korlátlan: ha a H3-ra épülő kereskedelmi termék vagy szolgáltatás éves bevétele meghaladja a 20 millió dollárt, külön írásos engedély kell a MiniMaxtól. A felületen a modell nevét is fel kell tüntetni.
A ranglista erős eredményt mutat, nem végleges ítéletet
Az Artificial Analysis videós arénája névtelen párokban mutatja meg a modellek eredményeit, a felhasználók pedig kiválasztják a jobbat. A videószerkesztési, hangot is figyelembe vevő listán a H3 most 1130-as Elo-ponttal vezet. Szövegből videó készítésében második, képből videó készítésében harmadik.
Ezek a helyezések a további szavazatokkal változhatnak, és nem mérnek minden gyakorlati szempontot. Nem derül ki belőlük például, milyen hardver kell a helyi futtatáshoz, mennyire következetes a modell hosszabb munkában, vagy mennyi kézi javítást kér egy valódi produkcióban. A H3 ettől még ritka helyzetet teremtett: letölthető súlyú modell került egy olyan összesített videós lista élére, amelyet eddig jellemzően zárt szolgáltatások uraltak.