CoAI
Notizie

Google lancia Gemini 3.8 Flash TTS, il modello di sintesi vocale con oltre 2.000 voci e clonazione da 30 secondi di audio

Il 23 settembre 2026 Google ha lanciato Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS, due modelli di sintesi vocale (TTS). Offrono oltre 2.000 voci, permettono di creare nuove voci partendo da istruzioni scritte e possono riprodurre una voce a partire da 30 secondi di audio.

23 settembre 2026Lettura: 2 min

Il 23 settembre 2026 Google ha lanciato due nuovi modelli di sintesi vocale (lettura del testo, TTS): Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS. Google presenta entrambi come i suoi modelli di generazione vocale più espressivi.

Le differenze tra i due modelli

  • Gemini 3.8 Flash TTS: pensato per gli usi in cui conta l'espressività, come una regia vocale accurata o la creazione di personaggi
  • Gemini 3.8 Flash-Lite TTS: pensato per generare grandi volumi di audio a basso costo

Le funzioni principali

  • Oltre 2.000 voci pronte all'uso
  • Supporto per più di 100 lingue e dialetti, con la possibilità di creare nuove voci descrivendo per iscritto ruolo, accento e caratteristiche della voce
  • Clonazione di una voce a partire da un campione audio di 30 secondi
  • Controllo, battuta per battuta, di ritmo, emozione e perfino dei suoni naturali tipici di una conversazione
  • Voce coerente anche nella lettura di testi lunghi e generazione di dialoghi tra due interlocutori

Secondo Google, Flash TTS si è classificato al primo posto (con un punteggio di 71,4) nel benchmark di progettazione vocale di Hume AI. Inoltre, nella classifica di Voice Arena, entrambi i modelli hanno conquistato posizioni di vertice davanti alla concorrenza in diverse lingue, tra cui giapponese, portoghese brasiliano e vietnamita.

Misure di sicurezza

Tutto l'audio generato contiene SynthID, una filigrana digitale che indica che è stato creato dall'IA. La clonazione della voce prevede un meccanismo di verifica del consenso della persona interessata, e i modelli supportano C2PA, lo standard che registra la provenienza dei contenuti.

La clonazione della voce non è però disponibile negli stati dell'Illinois e del Texas negli Stati Uniti, nello Spazio economico europeo (SEE), nel Regno Unito, in Svizzera e in India.

Dove si può usare

Entrambi i modelli sono disponibili nell'API di Gemini e in Google AI Studio, e a breve arriveranno anche su Gemini Enterprise. Inoltre Flash TTS è già disponibile per tutti gli utenti di Gemini Notebook e Flash-Lite TTS per tutti quelli di Google Vids.

Il punto di vista di CoAI

Oltre all'ampia scelta di voci, il punto di forza è la possibilità di creare nuove voci con semplici istruzioni scritte. Potrebbe diventare un'opzione da considerare per molti usi legati all'audio, dalla narrazione alla produzione video fino allo sviluppo di assistenti vocali. Chi intende usare la clonazione della voce farà bene a verificare prima le aree in cui è disponibile e la procedura di verifica del consenso.

Fonti

Strumenti citati in questo articolo

Torna alle notizie