CoAI
新聞

Google推出語音合成模型Gemini 3.8 Flash TTS,提供超過2,000種聲音,30秒音訊即可複製聲音

Google於2026年9月23日推出語音合成(TTS)模型Gemini 3.8 Flash TTS與Gemini 3.8 Flash-Lite TTS。除了可使用超過2,000種聲音,也能以文字指示打造新聲音,或從30秒的音訊複製聲音。

2026年9月23日閱讀約2分鐘

2026年9月23日,Google推出語音合成(文字轉語音,TTS)新模型Gemini 3.8 Flash TTS與Gemini 3.8 Flash-Lite TTS。Google將這兩款模型定位為旗下表現力最豐富的語音生成模型。

兩款模型的差異

  • Gemini 3.8 Flash TTS:適合細膩演出、角色塑造等講究表現力的用途
  • Gemini 3.8 Flash-Lite TTS:適合以低成本大量生成語音的用途

主要功能

  • 提供超過2,000種可直接使用的聲音
  • 支援100多種語言與方言,只要用文字描述角色、口音與聲音特色,就能打造新聲音
  • 只需30秒的語音樣本,就能複製出相同的聲音
  • 可逐句指定說話速度、情緒,甚至是讓對話聽起來更自然的各種聲音
  • 朗讀長篇文字時聲音表現穩定,也能生成兩位說話者之間的對話

根據Google的說法,Flash TTS在Hume AI的聲音設計基準測試中排名第一(分數71.4)。此外,在Voice Arena排行榜上,兩款模型在日語、巴西葡萄牙語、越南語等多種語言中勝過競爭對手,名列前茅。

安全措施

所有生成的語音都會嵌入SynthID數位浮水印,標示內容由AI生成。聲音複製功能設有確認本人同意的機制,並支援記錄內容來源的C2PA。

另外,聲音複製功能無法在美國伊利諾州與德州、歐洲經濟區(EEA)、英國、瑞士及印度使用。

提供平台

兩款模型都能在Gemini API與Google AI Studio中使用,近期也將支援Gemini Enterprise。此外,所有使用者都已能在Gemini Notebook中使用Flash TTS,在Google Vids中使用Flash-Lite TTS。

CoAI編輯部觀點

除了聲音種類豐富,只要下文字指示就能打造新聲音也是一大特色。從旁白、影片製作到語音助理開發,在各種與語音相關的用途中,都可望成為選項之一。若要使用聲音複製功能,請事先確認可使用的地區與同意確認的流程。

資料來源

本文介紹的工具

返回新聞列表