// ai/mi · 2026.09.29 Microsoft Quine: biológiai AI világmodell érkezett A Microsoft Research bemutatta a Quine rendszert: a multimodális biológiai világmodell a molekuláris szintektől a sejtekig képes szimulációkat végezni. olvasás →

Új generációs beszéd- és hangmodelleket tett közzé a Microsoft AI mérnökcsapata kifejezetten a valós idejű, interaktív hangágensek kiszolgálására. A hivatalos műszaki bejelentés középpontjában a valós idejű hangátírásra tervezett MAI-Transcribe-2-Streaming, valamint két szövegfelolvasó (TTS) megoldás, a többnyelvű MAI-Voice-2.1 és a rendkívül alacsony késleltetésű MAI-Voice-2.1-Flash áll.

A MAI-Transcribe-2 streaming modell hivatalos grafikája
A valós idejű MAI-Transcribe-2-Streaming modell hivatalos bemutató grafikája. Forrás: Microsoft AI

Részeredmények 100 ezredmásodperc alatt

A MAI-Transcribe-2-Streaming a vállalat első kifejezetten folyamatos adatfolyamra (streaming) optimalizált beszédfelismerője. A modell 60 nyelvet támogat automatikus és megszakítás nélküli nyelvfelismerés mellett. Az Artificial Analysis 2026. szeptember végi független tesztjein mind a végleges átírás pontosságában, mind a részleges köztes eredmények pontosságában az első helyre került, a Pareto-határvonalon egyesítve az alacsony hibaarányt és a minimális késleltetést.

A hagyományos eljárások megvárják, amíg a beszélő befejezi a mondatot. Ezzel szemben a rendszer már a hang beérkezése után alig több mint 100 milliszekundummal kiadja az első részleges feltevéseket (úgynevezett partials értékeket). Ahogy újabb környezeti kontextus érkezik, folyamatosan pontosítja a szöveget, és azonnal véglegesíti a stabil szakaszokat. A beszédalapú AI-ágensek így már a mondat közben megkezdhetik az érvelést vagy a külső szoftveres eszközök meghívását, a feliratok pedig kétszer gyorsabban jelennek meg a rivális megoldásokhoz képest. Az audioórákra vetített bevezetési díj az év végéig 0,54 dollár.

A közzétett beszédmodellek főbb paraméterei

Az új modellek lefedik a teljes kétirányú beszédciklust a hang feldolgozásától a szintetizált válaszig:

ModellSzerepkörKésleltetés és teljesítményNyelvi támogatásÁrazás
MAI-Transcribe-2-StreamingBeszédfelismerés és átírás (STT)Első részeredmény: ~100 ms60 nyelv (folyamatos felismerés)0,54 $ / óra (bevezető ár)
MAI-Voice-2.1Többnyelvű felolvasás (TTS)Kifejező, hosszú távon stabil tónus23 nyelv (26 dialektus, natív akcentus)22 $ / 1M karakter
MAI-Voice-2.1-FlashAlacsony késleltetésű TTS150 ms végpontok közötti késleltetés23 nyelv (klónozás pár másodpercből)15 $ / 1M karakter

Közös hangidentitás 23 nyelven és Turing-teszt

A felolvasó oldalon a MAI-Voice-2.1 huszonhárom nyelvet és huszonhat nyelvterületet kezel. A fejlesztők kulcsfontosságú újítása, hogy egyetlen kiválasztott szintetikus beszédhang képes mind a 23 nyelven hiteles, helyi akcentussal megszólalni. Amikor a modell angolról mandarinra vagy németre vált, a hang karakterisztikája változatlan marad, miközben nem viszi át a korábbi nyelv akcentusát a másikra. Mindkét modell képes pár másodpercnyi referenciahangból klónozni az adott orgánumot, a visszaéléseket pedig beépített beleegyezési szűrők hivatottak megakadályozni.

A nagy terhelésre szánt MAI-Voice-2.1-Flash változat a sebességre összpontosít: 45 másodpercnyi hangot mindössze 150 milliszekundumos végpontok közötti késleltetéssel állít elő, 55 százalékkal gyorsabb következtetéssel és milliónként 15 dolláros árcédulával. Egy négyezer fős vakteszten a hallgatók 50,3 százaléka a gépi mintát az emberi felvételekkel egyenértékűnek vagy természetesebbnek ítélte.

A beszédalapú ágensek zárt működési hurka

A hangvezérelt ágensfolyamatok működése szigorúan zárt láncot alkot: hallás (átírás), megértés és döntéshozatal (nyelvi modell), majd beszéd (szintetizálás). Ahhoz, hogy az emberi partner folyamatos párbeszédként élje meg a kapcsolatot, a teljes láncnak egy meghatározott időkereten belül kell maradnia. A bevitt és a visszacsatolt hang késleltetésének lefaragása közvetlenül felszabadítja az értékes időt a gondolkodó nagy nyelvi modell számára, amely így összetettebb feladatokat hajthat végre, mint amilyeneket a tudástárakat kezelő dedikált ágensek vagy a rivális Gemini 4 Argon szintű csúcsmodellek igényelnek.

A technológia a felhős Azure Foundry és az OpenRouter platformjain válik elérhetővé, miközben a vállalat egy Chatter nevű, közvetlenül kipróbálható demonstrációs felületen is szemlélteti a valós idejű működést a fejlesztők számára.