// ai/mi · 2026.09.23 Alibaba Cloud: új AI-adatközpontok nyílnak Európában A következő tizenkét hónap során három új európai felhőrégiót nyit az Alibaba Cloud: a techóriás Hollandiában, Finnországban és Törökországban létesít új adatközpontokat – jelentette be… olvasás →

Az Alibaba mesterséges intelligencia fejlesztőcsapata bemutatta a Qwen-Audio-3.1 modellcsaládot, amely öt új architektúrát vonultat fel a beszédfelismerés, a beszédszintézis és a valós idejű hangalapú interakció terén – számolt be a bejelentésről a The Decoder szakmai elemzése. A technológiai fejlesztések mellett a vállalat agresszív árazási stratégiát hirdetett a felhős infrastruktúrájában: a beszédszintézis (TTS) díjait mintegy 70 százalékkal, a valós idejű beszédmodellekét 85 százalékkal, az automatikus beszédfelismerés (ASR) költségeit pedig akár 95 százalékkal mérsékelte a nyugati felhőszolgáltatókkal szemben.

Öt specializált modell a beszédfeldolgozásra

A termékcsalád alapját az automatikus beszédfelismerésre kihegyezett ASR és ASR-Next modellek adják. Az alapmodell a többnyelvű és nyelvjárási beszédfelismerést fejleszti, miközben automatikusan kiszűri a hanganyagokból a töltelékszavakat és az akaratlan ismétléseket. Az ASR-Next változat ezt több beszélőt megkülönböztető diarizációval, másodpercre pontos időbélyegekkel, valamint érzelem- és környezeti zajdetektálással egészíti ki, felismerve a háttérben zúgó gépi zajokat is.

A beszédszintézist a TTS és a kísérleti TTS-Next fedi le. A felhasználók egyszerű szöveges promptokkal szabályozhatják a generált hang hanglejtését, tempóját és stílusát, megadva például a parancsoló vagy a megnyugtató tónust. A TTS-Next architektúra nagy nyelvi modellt ötvöz diffúziós megközelítéssel: a rendszer egyetlen menetben hoz létre emberi beszédet, hangeffekteket és környezeti háttérzenét, komplett filmes hangképet építve fel a bemeneti szöveg alapján.

Qwen Audio architektúra felépítése: Audio Encoder, nyelvi gerinc és feladatmodulok
Forrás: Alibaba Qwen / arXiv

Valós idejű párbeszéd és hatalmas kontextusablak

A valós idejű kommunikációra tervezett Realtime modell kétirányú, szimultán beszédet és hallgatást tesz lehetővé azonnali megszakítási képességgel. A rendszer figyeli a felhasználó beszédhangulatát: lehangoltságot észlelve automatikusan lassabb beszédtempóra és empatikusabb megfogalmazásokra vált. A kiadott Realtime-Plus változat ráadásul 262 144 tokenes kontextusablakkal dolgozik, ami lehetővé teszi a hosszas, többfordulós ágenses párbeszédek fenntartását és a külső eszközhívások stabil koordinálását.

A modellek technikai hátterét részletező nyilvános műszaki dokumentáció szerint a mérnökök az audio kódoló és a nyelvi modell gerincét többcélú illesztőrétegekkel kapcsolták össze. A közvetlen hang-hang következtetés révén a modell átlépi a korábbi, kaszkádolt rendszerek felesleges késleltetési lépcsőit.

A modellcsalád és a felhős árcsökkentés

Az alábbi táblázat a Qwen Audio 3.1 felhozatalát és az Alibaba Cloud Model Studio hivatalos díjcsökkentéseit foglalja össze:

ModellváltozatFő funkcióKulcsjellemzőÁrcsökkentés mértéke
Qwen-Audio-3.1-ASRBeszédfelismerésNyelvjárás-kezelés, töltelékszavak szűréseAkár 95%
Qwen-Audio-3.1-ASR-NextBeszélőazonosításIdőbélyegek, érzelem- és zajdetektálásAkár 95%
Qwen-Audio-3.1-TTSBeszédszintézisPrompt-alapú stílus- és tónusvezérlés~70%
Qwen-Audio-3.1-TTS-NextTeljes hangkép-generálásBeszéd, hangeffekt és háttérzene egy menetben~70%
Qwen-Audio-3.1-RealtimeKétirányú hanginterakcióFull-duplex, 262k kontextus, ágenses vezérlés~85%

A drasztikus árcsökkentés közvetlen kihívást intéz a hangalapú AI-piacot uraló nyugati szolgáltatók felé. A fejlesztők az Alibaba Cloud felületén keresztül azonnal munkára foghatják a modelleket, a nyílt súlyú változatok megjelenése pedig a helyi kiszolgálást tervező vállalati ügyfelek integrációs költségeit is mérsékli.