// SMARTWORLD — INTELLIGENZA ARTIFICIALE
Gemini 3.8 Flash TTS: Google lancia la sintesi vocale AI che in 30 secondi clona la tua voce
Google ha appena lanciato due nuovi modelli di sintesi vocale basati su Gemini, e il salto rispetto a quello che c'era prima è notevole e anche un po' preoccupante. Con Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS, chiunque può creare una voce completamente nuova partendo da zero, descrivendo a parole come deve suonare, oppure replicarne una esistente con soli 30 secondi di audio di riferimento.
Il risultato è qualcosa che assomiglia molto a un studio di doppiaggio virtuale, accessibile via API o direttamente da Gemini Notebook. E i benchmark iniziali parlano chiaro: il modello Flash TTS ha conquistato il primo posto nell'Overall Quality Index di Hume AI, con il Flash-Lite subito dietro al secondo. Una doppietta che è segno di qualità ma anche un campanello di attenzione.
Preferisci ascoltare il riassunto audio? Abbiamo scelto una voce realizzata con strumenti avanzati IA per rendere rendere i nostri testi subito accessibili a tutti
Il punto più interessante non è la qualità audio in sé, ma il livello di controllo che questi modelli offrono.
Con Gemini 3.8 Flash TTS è possibile dirigere ogni singola riga di dialogo come farebbe un regista: specificare il ritmo, l'emozione, l'accento, persino aggiungere suoni non verbali come risate, sospiri o interiezioni conversazionali (tipo "mhm" o "già") usando tag appositi nel testo. In pratica, scrivi uno script e il modello lo interpreta, non si limita a leggerlo.
È supportata anche la gestione nativa di due voci in contemporanea: si può scrivere un dialogo tra due personaggi e il modello gestisce i turni di parola in modo naturale, tenendo le due voci ben distinte. Utile per podcast, audiolibri o qualsiasi produzione audio narrativa.
Il modello Flash-Lite, invece, è pensato per chi ha bisogno di volumi elevati a costi contenuti: doppiaggio su larga scala, agenti vocali, localizzazione di contenuti multimediali. Meno flessibilità creativa, ma ottimizzato per girare in produzione senza far esplodere i costi.
La libreria di partenza conta oltre 2.000 voci pronte all'uso, con copertura linguistica che include varietà regionali come lo spagnolo messicano, il francese del Québec e l'inglese scozzese.
Ma il vero punto di forza è la possibilità di creare voci originali da zero tramite prompt in linguaggio naturale: vuoi un DJ dall'energia esplosiva con accento australiano? Un robot monotono e metallico? Un drago giapponese? Basta descriverlo.
La replica vocale funziona partendo da un campione audio di 30 secondi, ma Google ha inserito un sistema di verifica del consenso: prima di replicare una voce, il proprietario deve registrare un messaggio di consenso esplicito. Ogni audio generato viene poi marcato con SynthID, il watermark invisibile di Google che permette di identificare i contenuti generati dall'AI anche dopo eventuali modifiche, per contrastare la disinformazione.