Az Nvidia elindította a Nemotron 3 VoiceChat korai hozzáférését. A vállalat fejlesztői oldala szerint ez egy 12 milliárd paraméteres, teljes duplex beszéd-beszéd modell, amely a beszédfelismerést, a nyelvi modellt és a beszédszintézist egy rendszerbe fogja össze.

// ai/mi · 2026.08.04 Egy kínai robot-AI legyőzte az Nvidiát, aztán újraírták a szabályokat A kínai Spirit AI júniusban az Nvidia elé került, aztán kiderült, hogy az értékelések meglepően nagy részét néhány fiók futtatta. Csalást nem bizonyítottak, a ranglista… olvasás →

A teljes duplex itt azt jelenti, hogy a modell nem feltétlenül várja meg, amíg a másik fél végigmondja a mondatát. Képes a természetesebbnek szánt párbeszédre, vagyis megszólalhat, félbeszakítható, és közben reagálhat az új hanginformációra.

Nem három egymás után fűzött komponens

Sok hangalapú asszisztens külön lépésben alakítja szöveggé a beszédet, készíti el a választ, majd olvassa fel azt. A Nemotron 3 VoiceChat e három feladatot egyetlen architektúrában kezeli. Az Nvidia szerint ezzel egy másodperc alatti, megszakítható válaszokat céloz.

Ez különösen ügyfélszolgálati, telefonos és más, folyamatos párbeszédet igénylő rendszereknél lehet fontos. A gyakorlatban a késleltetés mellett az is számít, mennyire érti jól a modell a félbehagyott mondatokat, a közbevágást és a beszélgetés ritmusát.

Nyílt súlyok, de nem kész fogyasztói asszisztens

Az Nvidia a modell súlyait megismerhetőként és vállalati telepítésre alkalmasnak írja le, a korai hozzáférés résztvevői pedig referencia-konténereket és finomhangolási útmutatót is kapnak. Ez nem egy kész, mindenki számára bekapcsolható chatbot: a fejlesztőknek továbbra is saját környezetet, biztonsági szabályokat és alkalmazást kell építeniük köré.

A hivatalos adatlapon 12B szerepel, ezért ezt az értéket érdemes használni; a korábbi, 11B-s hivatkozások pontatlanok voltak.