Em 23 de setembro de 2026, o Google lançou dois novos modelos de síntese de voz (conversão de texto em fala, TTS): o Gemini 3.8 Flash TTS e o Gemini 3.8 Flash-Lite TTS. O Google apresenta os dois como seus modelos de geração de voz mais expressivos.
A diferença entre os dois modelos
- Gemini 3.8 Flash TTS: voltado para usos em que a expressividade importa, como direção de voz detalhada e criação de personagens
- Gemini 3.8 Flash-Lite TTS: voltado para gerar grandes volumes de áudio com baixo custo
Principais recursos
- Mais de 2 mil vozes prontas para usar
- Suporte a mais de 100 idiomas e dialetos, com a possibilidade de criar vozes novas definindo papel, sotaque e características da voz apenas com instruções em texto
- Clonagem de uma voz a partir de uma amostra de áudio de 30 segundos
- Controle, fala por fala, do ritmo, da emoção e até dos sons naturais típicos de uma conversa
- Voz consistente mesmo na leitura de textos longos e geração de diálogos entre duas pessoas
Segundo o Google, o Flash TTS ficou em 1º lugar (com pontuação de 71,4) no benchmark de design de voz da Hume AI. Além disso, no ranking do Voice Arena, os dois modelos alcançaram posições de destaque à frente dos concorrentes em vários idiomas, como japonês, português brasileiro e vietnamita.
Medidas de segurança
Todo áudio gerado recebe o SynthID, uma marca d'água digital que indica que o conteúdo foi criado por IA. A clonagem de voz conta com um mecanismo para confirmar o consentimento da pessoa, e os modelos são compatíveis com o C2PA, padrão que registra a procedência do conteúdo.
Vale notar que a clonagem de voz não está disponível nos estados de Illinois e Texas, nos Estados Unidos, no Espaço Econômico Europeu (EEE), no Reino Unido, na Suíça e na Índia.
Onde usar
Os dois modelos estão disponíveis na API do Gemini e no Google AI Studio, e em breve chegarão também ao Gemini Enterprise. Além disso, o Flash TTS já está liberado para todos os usuários do Gemini Notebook, e o Flash-Lite TTS, para todos os usuários do Google Vids.
A visão do CoAI
Além da grande variedade de vozes, o principal diferencial é poder criar vozes novas só com instruções em texto. O modelo tende a se tornar uma opção para vários usos ligados a áudio, de narração e produção de vídeo ao desenvolvimento de assistentes de voz. Se você pretende usar a clonagem de voz, confira antes em quais regiões ela está disponível e como funciona a confirmação de consentimento.