Il 23 settembre 2026 Google ha lanciato due nuovi modelli di sintesi vocale (lettura del testo, TTS): Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS. Google presenta entrambi come i suoi modelli di generazione vocale più espressivi.
Le differenze tra i due modelli
- Gemini 3.8 Flash TTS: pensato per gli usi in cui conta l'espressività, come una regia vocale accurata o la creazione di personaggi
- Gemini 3.8 Flash-Lite TTS: pensato per generare grandi volumi di audio a basso costo
Le funzioni principali
- Oltre 2.000 voci pronte all'uso
- Supporto per più di 100 lingue e dialetti, con la possibilità di creare nuove voci descrivendo per iscritto ruolo, accento e caratteristiche della voce
- Clonazione di una voce a partire da un campione audio di 30 secondi
- Controllo, battuta per battuta, di ritmo, emozione e perfino dei suoni naturali tipici di una conversazione
- Voce coerente anche nella lettura di testi lunghi e generazione di dialoghi tra due interlocutori
Secondo Google, Flash TTS si è classificato al primo posto (con un punteggio di 71,4) nel benchmark di progettazione vocale di Hume AI. Inoltre, nella classifica di Voice Arena, entrambi i modelli hanno conquistato posizioni di vertice davanti alla concorrenza in diverse lingue, tra cui giapponese, portoghese brasiliano e vietnamita.
Misure di sicurezza
Tutto l'audio generato contiene SynthID, una filigrana digitale che indica che è stato creato dall'IA. La clonazione della voce prevede un meccanismo di verifica del consenso della persona interessata, e i modelli supportano C2PA, lo standard che registra la provenienza dei contenuti.
La clonazione della voce non è però disponibile negli stati dell'Illinois e del Texas negli Stati Uniti, nello Spazio economico europeo (SEE), nel Regno Unito, in Svizzera e in India.
Dove si può usare
Entrambi i modelli sono disponibili nell'API di Gemini e in Google AI Studio, e a breve arriveranno anche su Gemini Enterprise. Inoltre Flash TTS è già disponibile per tutti gli utenti di Gemini Notebook e Flash-Lite TTS per tutti quelli di Google Vids.
Il punto di vista di CoAI
Oltre all'ampia scelta di voci, il punto di forza è la possibilità di creare nuove voci con semplici istruzioni scritte. Potrebbe diventare un'opzione da considerare per molti usi legati all'audio, dalla narrazione alla produzione video fino allo sviluppo di assistenti vocali. Chi intende usare la clonazione della voce farà bene a verificare prima le aree in cui è disponibile e la procedura di verifica del consenso.