CoAI
Noticias

Google lanza Gemini 3.8 Flash TTS, su modelo de síntesis de voz con más de 2000 voces y clonación a partir de 30 segundos

El 23 de septiembre de 2026, Google lanzó Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS, dos modelos de síntesis de voz (TTS). Ofrecen más de 2000 voces, permiten crear voces nuevas a partir de instrucciones escritas y pueden clonar una voz a partir de 30 segundos de audio.

23 de septiembre de 2026Lectura de 2 min

El 23 de septiembre de 2026, Google lanzó dos nuevos modelos de síntesis de voz (conversión de texto a voz, TTS): Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS. Google presenta ambos como sus modelos de generación de voz más expresivos.

Diferencias entre los dos modelos

  • Gemini 3.8 Flash TTS: pensado para usos en los que importa la expresividad, como una dirección vocal detallada o la creación de personajes
  • Gemini 3.8 Flash-Lite TTS: pensado para generar grandes volúmenes de audio a bajo coste

Funciones principales

  • Más de 2000 voces listas para usar
  • Compatibilidad con más de 100 idiomas y dialectos, y creación de voces nuevas definiendo con instrucciones escritas el papel, el acento y las características de la voz
  • Clonación de una voz a partir de una muestra de audio de 30 segundos
  • Control, frase a frase, del ritmo, la emoción e incluso los sonidos naturales propios de una conversación
  • Voz estable incluso en textos largos y generación de diálogos entre dos interlocutores

Según Google, Flash TTS ocupa el primer puesto (con una puntuación de 71,4) en el benchmark de diseño de voz de Hume AI. Además, en la clasificación de Voice Arena, ambos modelos se sitúan entre los mejores, por delante de la competencia, en varios idiomas, como el japonés, el portugués de Brasil y el vietnamita.

Medidas de seguridad

Todo el audio generado incluye SynthID, una marca de agua digital que indica que ha sido creado por IA. La clonación de voz cuenta con un mecanismo para verificar el consentimiento de la persona, y los modelos son compatibles con C2PA, el estándar que registra la procedencia del contenido.

Eso sí, la clonación de voz no está disponible en los estados de Illinois y Texas (Estados Unidos), el Espacio Económico Europeo (EEE), el Reino Unido, Suiza ni la India.

Dónde se puede usar

Ambos modelos están disponibles en la API de Gemini y en Google AI Studio, y pronto llegarán también a Gemini Enterprise. Además, Flash TTS ya está disponible para todos los usuarios de Gemini Notebook, y Flash-Lite TTS, para todos los usuarios de Google Vids.

El punto de vista de CoAI

Además de la enorme variedad de voces, su gran baza es que permite crear voces nuevas con simples instrucciones escritas. Puede convertirse en una opción a tener en cuenta para todo tipo de usos relacionados con el audio, desde la narración y la producción de vídeo hasta el desarrollo de asistentes de voz. Si vas a usar la clonación de voz, comprueba antes en qué regiones está disponible y cómo funciona la verificación del consentimiento.

Fuentes

Herramientas mencionadas en este artículo

Volver a las noticias