Nari Labs ha presentato Dia, un modello di sintesi vocale (TTS) open source che promette di rivoluzionare il panorama della generazione vocale. Con 1,6 miliardi di parametri, Dia è in grado di produrre voci estremamente naturali, includendo sfumature come pause, risate e persino respiri, rendendo le interazioni vocali più umane.

Una delle caratteristiche più impressionanti è la capacità di clonazione vocale: dato un breve campione, Dia può replicare fedelmente una voce, mantenendone le peculiarità emotive. Questo lo rende uno strumento potente per applicazioni in assistenti virtuali, narrazione automatica e accessibilità.
Rispetto a soluzioni chiuse come ElevenLabs o OpenAI, Dia si distingue per l’approccio open source, che consente maggiore trasparenza e personalizzazione da parte della community. L’obiettivo di Nari Labs è democratizzare la tecnologia TTS, rendendola accessibile a sviluppatori, ricercatori e creatori di contenuti.
Il rilascio di Dia potrebbe rappresentare un punto di svolta per il settore vocale generativo, aprendo le porte a un nuovo standard qualitativo, con una forte enfasi sull’etica e sull’uso responsabile della clonazione vocale.