El 23 de septiembre de 2026, Google lanzó dos nuevos modelos de síntesis de voz (conversión de texto a voz, TTS): Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS. Google presenta ambos como sus modelos de generación de voz más expresivos.
Diferencias entre los dos modelos
- Gemini 3.8 Flash TTS: pensado para usos en los que importa la expresividad, como una dirección vocal detallada o la creación de personajes
- Gemini 3.8 Flash-Lite TTS: pensado para generar grandes volúmenes de audio a bajo coste
Funciones principales
- Más de 2000 voces listas para usar
- Compatibilidad con más de 100 idiomas y dialectos, y creación de voces nuevas definiendo con instrucciones escritas el papel, el acento y las características de la voz
- Clonación de una voz a partir de una muestra de audio de 30 segundos
- Control, frase a frase, del ritmo, la emoción e incluso los sonidos naturales propios de una conversación
- Voz estable incluso en textos largos y generación de diálogos entre dos interlocutores
Según Google, Flash TTS ocupa el primer puesto (con una puntuación de 71,4) en el benchmark de diseño de voz de Hume AI. Además, en la clasificación de Voice Arena, ambos modelos se sitúan entre los mejores, por delante de la competencia, en varios idiomas, como el japonés, el portugués de Brasil y el vietnamita.
Medidas de seguridad
Todo el audio generado incluye SynthID, una marca de agua digital que indica que ha sido creado por IA. La clonación de voz cuenta con un mecanismo para verificar el consentimiento de la persona, y los modelos son compatibles con C2PA, el estándar que registra la procedencia del contenido.
Eso sí, la clonación de voz no está disponible en los estados de Illinois y Texas (Estados Unidos), el Espacio Económico Europeo (EEE), el Reino Unido, Suiza ni la India.
Dónde se puede usar
Ambos modelos están disponibles en la API de Gemini y en Google AI Studio, y pronto llegarán también a Gemini Enterprise. Además, Flash TTS ya está disponible para todos los usuarios de Gemini Notebook, y Flash-Lite TTS, para todos los usuarios de Google Vids.
El punto de vista de CoAI
Además de la enorme variedad de voces, su gran baza es que permite crear voces nuevas con simples instrucciones escritas. Puede convertirse en una opción a tener en cuenta para todo tipo de usos relacionados con el audio, desde la narración y la producción de vídeo hasta el desarrollo de asistentes de voz. Si vas a usar la clonación de voz, comprueba antes en qué regiones está disponible y cómo funciona la verificación del consentimiento.