Új generációs beszéd- és hangmodelleket tett közzé a Microsoft AI mérnökcsapata kifejezetten a valós idejű, interaktív hangágensek kiszolgálására. A hivatalos műszaki bejelentés középpontjában a valós idejű hangátírásra tervezett MAI-Transcribe-2-Streaming, valamint két szövegfelolvasó (TTS) megoldás, a többnyelvű MAI-Voice-2.1 és a rendkívül alacsony késleltetésű MAI-Voice-2.1-Flash áll.

Részeredmények 100 ezredmásodperc alatt
A MAI-Transcribe-2-Streaming a vállalat első kifejezetten folyamatos adatfolyamra (streaming) optimalizált beszédfelismerője. A modell 60 nyelvet támogat automatikus és megszakítás nélküli nyelvfelismerés mellett. Az Artificial Analysis 2026. szeptember végi független tesztjein mind a végleges átírás pontosságában, mind a részleges köztes eredmények pontosságában az első helyre került, a Pareto-határvonalon egyesítve az alacsony hibaarányt és a minimális késleltetést.
A hagyományos eljárások megvárják, amíg a beszélő befejezi a mondatot. Ezzel szemben a rendszer már a hang beérkezése után alig több mint 100 milliszekundummal kiadja az első részleges feltevéseket (úgynevezett partials értékeket). Ahogy újabb környezeti kontextus érkezik, folyamatosan pontosítja a szöveget, és azonnal véglegesíti a stabil szakaszokat. A beszédalapú AI-ágensek így már a mondat közben megkezdhetik az érvelést vagy a külső szoftveres eszközök meghívását, a feliratok pedig kétszer gyorsabban jelennek meg a rivális megoldásokhoz képest. Az audioórákra vetített bevezetési díj az év végéig 0,54 dollár.
A közzétett beszédmodellek főbb paraméterei
Az új modellek lefedik a teljes kétirányú beszédciklust a hang feldolgozásától a szintetizált válaszig:
| Modell | Szerepkör | Késleltetés és teljesítmény | Nyelvi támogatás | Árazás |
|---|---|---|---|---|
| MAI-Transcribe-2-Streaming | Beszédfelismerés és átírás (STT) | Első részeredmény: ~100 ms | 60 nyelv (folyamatos felismerés) | 0,54 $ / óra (bevezető ár) |
| MAI-Voice-2.1 | Többnyelvű felolvasás (TTS) | Kifejező, hosszú távon stabil tónus | 23 nyelv (26 dialektus, natív akcentus) | 22 $ / 1M karakter |
| MAI-Voice-2.1-Flash | Alacsony késleltetésű TTS | 150 ms végpontok közötti késleltetés | 23 nyelv (klónozás pár másodpercből) | 15 $ / 1M karakter |
Közös hangidentitás 23 nyelven és Turing-teszt
A felolvasó oldalon a MAI-Voice-2.1 huszonhárom nyelvet és huszonhat nyelvterületet kezel. A fejlesztők kulcsfontosságú újítása, hogy egyetlen kiválasztott szintetikus beszédhang képes mind a 23 nyelven hiteles, helyi akcentussal megszólalni. Amikor a modell angolról mandarinra vagy németre vált, a hang karakterisztikája változatlan marad, miközben nem viszi át a korábbi nyelv akcentusát a másikra. Mindkét modell képes pár másodpercnyi referenciahangból klónozni az adott orgánumot, a visszaéléseket pedig beépített beleegyezési szűrők hivatottak megakadályozni.
A nagy terhelésre szánt MAI-Voice-2.1-Flash változat a sebességre összpontosít: 45 másodpercnyi hangot mindössze 150 milliszekundumos végpontok közötti késleltetéssel állít elő, 55 százalékkal gyorsabb következtetéssel és milliónként 15 dolláros árcédulával. Egy négyezer fős vakteszten a hallgatók 50,3 százaléka a gépi mintát az emberi felvételekkel egyenértékűnek vagy természetesebbnek ítélte.
A beszédalapú ágensek zárt működési hurka
A hangvezérelt ágensfolyamatok működése szigorúan zárt láncot alkot: hallás (átírás), megértés és döntéshozatal (nyelvi modell), majd beszéd (szintetizálás). Ahhoz, hogy az emberi partner folyamatos párbeszédként élje meg a kapcsolatot, a teljes láncnak egy meghatározott időkereten belül kell maradnia. A bevitt és a visszacsatolt hang késleltetésének lefaragása közvetlenül felszabadítja az értékes időt a gondolkodó nagy nyelvi modell számára, amely így összetettebb feladatokat hajthat végre, mint amilyeneket a tudástárakat kezelő dedikált ágensek vagy a rivális Gemini 4 Argon szintű csúcsmodellek igényelnek.
A technológia a felhős Azure Foundry és az OpenRouter platformjain válik elérhetővé, miközben a vállalat egy Chatter nevű, közvetlenül kipróbálható demonstrációs felületen is szemlélteti a valós idejű működést a fejlesztők számára.