CoAI
新闻

Google发布语音合成模型Gemini 3.8 Flash TTS,提供超过2,000种声音,30秒音频即可复刻声音

Google于2026年9月23日发布语音合成(TTS)模型Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS。用户可使用超过2,000种声音,还能通过文字指令创建新声音,或根据30秒音频复刻声音。

2026年9月23日阅读约2分钟

2026年9月23日,Google发布了语音合成(文字转语音,TTS)新模型Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS。Google将这两款模型定位为其表现力最强的语音生成模型。

两款模型的区别

  • Gemini 3.8 Flash TTS:适合精细演绎、角色塑造等注重表现力的场景
  • Gemini 3.8 Flash-Lite TTS:适合以低成本大量生成语音的场景

主要功能

  • 提供超过2,000种开箱即用的声音
  • 支持100多种语言和方言,只需用文字描述角色、口音和音色特点,即可创建新声音
  • 根据30秒的语音样本,即可复刻出相同的声音
  • 可逐句指定语速、情感,乃至让对话听起来更自然的各种声音
  • 朗读长文本时音色保持稳定,还能生成两位说话人之间的对话

据Google介绍,Flash TTS在Hume AI的语音设计基准测试中排名第一(得分71.4)。此外,在Voice Arena排行榜上,两款模型在日语、巴西葡萄牙语、越南语等多种语言中力压竞争对手,跻身前列。

安全措施

所有生成的语音都会嵌入SynthID数字水印,用于标明内容由AI生成。声音复刻功能设有确认本人同意的机制,并支持记录内容来源的C2PA。

需要注意的是,声音复刻功能在美国伊利诺伊州和得克萨斯州、欧洲经济区(EEA)、英国、瑞士及印度无法使用。

上线平台

两款模型均可在Gemini API和Google AI Studio中使用,并将很快支持Gemini Enterprise。此外,所有用户都已可以在Gemini Notebook中使用Flash TTS,在Google Vids中使用Flash-Lite TTS。

CoAI编辑部观点

除了声音种类丰富,只需文字指令即可创建新声音也是一大亮点。在旁白配音、视频制作、语音助手开发等各类涉及语音的场景中,它都有望成为可选方案之一。如需使用声音复刻功能,请事先确认可用地区和同意确认流程。

资料来源

本文提到的工具

返回资讯列表