2026年9月23日,Google推出語音合成(文字轉語音,TTS)新模型Gemini 3.8 Flash TTS與Gemini 3.8 Flash-Lite TTS。Google將這兩款模型定位為旗下表現力最豐富的語音生成模型。
兩款模型的差異
- Gemini 3.8 Flash TTS:適合細膩演出、角色塑造等講究表現力的用途
- Gemini 3.8 Flash-Lite TTS:適合以低成本大量生成語音的用途
主要功能
- 提供超過2,000種可直接使用的聲音
- 支援100多種語言與方言,只要用文字描述角色、口音與聲音特色,就能打造新聲音
- 只需30秒的語音樣本,就能複製出相同的聲音
- 可逐句指定說話速度、情緒,甚至是讓對話聽起來更自然的各種聲音
- 朗讀長篇文字時聲音表現穩定,也能生成兩位說話者之間的對話
根據Google的說法,Flash TTS在Hume AI的聲音設計基準測試中排名第一(分數71.4)。此外,在Voice Arena排行榜上,兩款模型在日語、巴西葡萄牙語、越南語等多種語言中勝過競爭對手,名列前茅。
安全措施
所有生成的語音都會嵌入SynthID數位浮水印,標示內容由AI生成。聲音複製功能設有確認本人同意的機制,並支援記錄內容來源的C2PA。
另外,聲音複製功能無法在美國伊利諾州與德州、歐洲經濟區(EEA)、英國、瑞士及印度使用。
提供平台
兩款模型都能在Gemini API與Google AI Studio中使用,近期也將支援Gemini Enterprise。此外,所有使用者都已能在Gemini Notebook中使用Flash TTS,在Google Vids中使用Flash-Lite TTS。
CoAI編輯部觀點
除了聲音種類豐富,只要下文字指示就能打造新聲音也是一大特色。從旁白、影片製作到語音助理開發,在各種與語音相關的用途中,都可望成為選項之一。若要使用聲音複製功能,請事先確認可使用的地區與同意確認的流程。