CoAI
Actualité

Google lance le modèle de synthèse vocale Gemini 3.8 Flash TTS : plus de 2 000 voix et clonage à partir de 30 secondes d'audio

Le 23 septembre 2026, Google a lancé Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS, deux modèles de synthèse vocale (TTS). Ils proposent plus de 2 000 voix, permettent de créer de nouvelles voix à partir d'instructions écrites et peuvent reproduire une voix à partir de 30 secondes d'audio.

23 septembre 2026Lecture : 2 min

Le 23 septembre 2026, Google a lancé deux nouveaux modèles de synthèse vocale (lecture de texte, TTS) : Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS. Google présente ces deux modèles comme ses modèles de génération vocale les plus expressifs.

Ce qui distingue les deux modèles

  • Gemini 3.8 Flash TTS : conçu pour les usages où l'expressivité compte, comme une direction vocale fine ou la création de personnages
  • Gemini 3.8 Flash-Lite TTS : conçu pour générer de gros volumes d'audio à moindre coût

Les principales fonctionnalités

  • Plus de 2 000 voix prêtes à l'emploi
  • Prise en charge de plus de 100 langues et dialectes, et création de nouvelles voix en décrivant simplement par écrit le rôle, l'accent et les caractéristiques de la voix
  • Clonage d'une voix à partir d'un échantillon audio de 30 secondes
  • Contrôle, réplique par réplique, du débit, de l'émotion et même des bruits naturels propres à une conversation
  • Une voix qui reste cohérente même sur de longs textes, et la génération de dialogues à deux voix

Selon Google, Flash TTS se classe premier (avec un score de 71,4) sur le benchmark de conception de voix de Hume AI. Par ailleurs, au classement Voice Arena, les deux modèles se hissent parmi les meilleurs, devant leurs concurrents, dans plusieurs langues, dont le japonais, le portugais du Brésil et le vietnamien.

Mesures de sécurité

Tous les contenus audio générés intègrent SynthID, un filigrane numérique signalant qu'ils ont été créés par une IA. Le clonage de voix s'accompagne d'un mécanisme de vérification du consentement de la personne concernée, et les modèles prennent en charge C2PA, le standard qui enregistre la provenance des contenus.

Le clonage de voix n'est toutefois pas disponible dans les États de l'Illinois et du Texas aux États-Unis, dans l'Espace économique européen (EEE), au Royaume-Uni, en Suisse ni en Inde.

Où l'utiliser

Les deux modèles sont disponibles dans l'API Gemini et dans Google AI Studio, et arriveront prochainement dans Gemini Enterprise. Par ailleurs, Flash TTS est accessible à tous les utilisateurs de Gemini Notebook, et Flash-Lite TTS à tous ceux de Google Vids.

Le regard de CoAI

Outre le très large choix de voix, son principal atout est de pouvoir créer de nouvelles voix à partir de simples instructions écrites. Il pourrait s'imposer comme une option pour toutes sortes d'usages liés à l'audio, de la narration à la production vidéo en passant par le développement d'assistants vocaux. Si vous comptez utiliser le clonage de voix, vérifiez au préalable les régions où il est disponible et la procédure de vérification du consentement.

Sources

Outils mentionnés dans cet article

Retour aux actualités