Nyilvános bétaként elindult a Suno új hanggeneráló szolgáltatása, a Speech, amellyel a korábban kizárólag generatív zenekészítésről ismert platform a felolvasott szövegek és narrációk területére lép be. A technológia sajátossága, hogy a gépi beszédhangot és a hozzá igazított instrumentális kísérőzenét egyetlen összefüggő hangsávként képes létrehozni webes felületen, valamint iOS és Android alkalmazásban.
A zenei alap nem kötelező része a generálásnak: a kezelőfelületen található kapcsolóval a háttérzene teljesen kiiktatható, így a modell hagyományos, tiszta szövegfelolvasóként is üzemel. A fejlesztők szándéka szerint az egyidejű zeneszerzés a dramatikus felolvasásoknál, hangoskönyveknél, meditációs anyagoknál vagy motivációs beszédeknél ad közvetlen zenei aláfestést az elhangzó gondolatokhoz.
Két üzemmód és legfeljebb nyolcperces időtartam
A funkció a szerkesztőfelület Create fülén belül érhető el, ahol a felhasználók két eltérő megközelítés közül választhatnak. Az egyszerűbb Simple módban mindössze egy szöveges leírást kell megadni az elérni kívánt hangulatról és karakterről, a rendszer pedig önállóan fogalmazza meg a felolvasott mondatokat és a hozzájuk társított zenét. A haladóknak szánt Advanced felületen a kész forgatókönyv közvetlenül bemásolható, a hang neme, a beszédstílus és az improvizációs variabilitás mértéke pedig külön csúszkákkal szabályozható.
A Speech egyetlen menetben legfeljebb nyolc percnyi folyamatos hanganyagot képes szintetizálni. Ez a korlát hosszabb novellák vagy összetett jelenetek rögzítését is lehetővé teszi anélkül, hogy a felhasználónak több különálló hangszeletet kellene utólag egymás mögé illesztenie egy külső hangszerkesztőben.
Kísérleti fázis és technikai korlátok
Jack Brody termékigazgató a hivatalos bejelentésben rögzítette, hogy a modell képességei még finomításra szorulnak a felhasználói visszajelzések alapján. A korai tesztek során előfordult, hogy a brit akcentus váratlanul ausztrál hanglejtésbe váltott át, miközben az érzelmi feszültség keltésére szánt drámai szünetek időnként aránytalanul hosszúra nyúltak.

A szöveges beszédgenerálás piaca az elmúlt években rendkívül telítetté vált: a Google DeepMind kísérletei, az Adobe beépített eszközei és az ElevenLabs audiomodelljei mellett a Suno a két réteg egyidejű, koherens felépítésével igyekszik megkülönböztetni a platformját. A több lábon állás üzletileg is sürgető feladat a bostoni székhelyű cég számára, hiszen a zenei generátort az amerikai és európai zeneipari jogvédők részéről több szerzői jogi per is fenyegeti a betanítási adatok jogszerűsége miatt.