2026年9月23日,Google发布了语音合成(文字转语音,TTS)新模型Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS。Google将这两款模型定位为其表现力最强的语音生成模型。
两款模型的区别
- Gemini 3.8 Flash TTS:适合精细演绎、角色塑造等注重表现力的场景
- Gemini 3.8 Flash-Lite TTS:适合以低成本大量生成语音的场景
主要功能
- 提供超过2,000种开箱即用的声音
- 支持100多种语言和方言,只需用文字描述角色、口音和音色特点,即可创建新声音
- 根据30秒的语音样本,即可复刻出相同的声音
- 可逐句指定语速、情感,乃至让对话听起来更自然的各种声音
- 朗读长文本时音色保持稳定,还能生成两位说话人之间的对话
据Google介绍,Flash TTS在Hume AI的语音设计基准测试中排名第一(得分71.4)。此外,在Voice Arena排行榜上,两款模型在日语、巴西葡萄牙语、越南语等多种语言中力压竞争对手,跻身前列。
安全措施
所有生成的语音都会嵌入SynthID数字水印,用于标明内容由AI生成。声音复刻功能设有确认本人同意的机制,并支持记录内容来源的C2PA。
需要注意的是,声音复刻功能在美国伊利诺伊州和得克萨斯州、欧洲经济区(EEA)、英国、瑞士及印度无法使用。
上线平台
两款模型均可在Gemini API和Google AI Studio中使用,并将很快支持Gemini Enterprise。此外,所有用户都已可以在Gemini Notebook中使用Flash TTS,在Google Vids中使用Flash-Lite TTS。
CoAI编辑部观点
除了声音种类丰富,只需文字指令即可创建新声音也是一大亮点。在旁白配音、视频制作、语音助手开发等各类涉及语音的场景中,它都有望成为可选方案之一。如需使用声音复刻功能,请事先确认可用地区和同意确认流程。