Az Nvidia elindította a Nemotron 3 VoiceChat korai hozzáférését. A vállalat fejlesztői oldala szerint ez egy 12 milliárd paraméteres, teljes duplex beszéd-beszéd modell, amely a beszédfelismerést, a nyelvi modellt és a beszédszintézist egy rendszerbe fogja össze.
A teljes duplex itt azt jelenti, hogy a modell nem feltétlenül várja meg, amíg a másik fél végigmondja a mondatát. Képes a természetesebbnek szánt párbeszédre, vagyis megszólalhat, félbeszakítható, és közben reagálhat az új hanginformációra.
Nem három egymás után fűzött komponens
Sok hangalapú asszisztens külön lépésben alakítja szöveggé a beszédet, készíti el a választ, majd olvassa fel azt. A Nemotron 3 VoiceChat e három feladatot egyetlen architektúrában kezeli. Az Nvidia szerint ezzel egy másodperc alatti, megszakítható válaszokat céloz.
Ez különösen ügyfélszolgálati, telefonos és más, folyamatos párbeszédet igénylő rendszereknél lehet fontos. A gyakorlatban a késleltetés mellett az is számít, mennyire érti jól a modell a félbehagyott mondatokat, a közbevágást és a beszélgetés ritmusát.
Nyílt súlyok, de nem kész fogyasztói asszisztens
Az Nvidia a modell súlyait megismerhetőként és vállalati telepítésre alkalmasnak írja le, a korai hozzáférés résztvevői pedig referencia-konténereket és finomhangolási útmutatót is kapnak. Ez nem egy kész, mindenki számára bekapcsolható chatbot: a fejlesztőknek továbbra is saját környezetet, biztonsági szabályokat és alkalmazást kell építeniük köré.
A hivatalos adatlapon 12B szerepel, ezért ezt az értéket érdemes használni; a korábbi, 11B-s hivatkozások pontatlanok voltak.