CoAI
ニュース

Google、音声合成モデル「Gemini 3.8 Flash TTS」を公開 2,000以上の声と30秒からの声の再現に対応

Googleは2026年9月23日、音声合成(TTS)モデル「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を公開しました。2,000以上の声を使えるほか、文章で指示して新しい声を作ったり、30秒の音声から声を再現したりできます。

2026年9月23日約2分で読めます

Googleは2026年9月23日、音声合成(テキスト読み上げ、TTS)の新モデル「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を公開しました。Googleは、この2つを同社で最も表現力の高い音声生成モデルと位置づけています。

2つのモデルの違い

  • Gemini 3.8 Flash TTS:細かな演出やキャラクターづくりなど、表現にこだわる用途向け
  • Gemini 3.8 Flash-Lite TTS:大量の音声を低コストで生成したい用途向け

主な機能

  • 2,000以上の、すぐに使える声を用意
  • 100以上の言語・方言に対応し、文章で指示するだけで役柄やアクセント、声の特徴を決めて新しい声を作れる
  • 30秒の音声サンプルから、同じ声を再現できる
  • セリフごとに、話す速さや感情、会話らしい自然な音まで指示できる
  • 長い文章を読み上げても声の印象がぶれにくく、2人の話者による会話も生成できる

Googleによると、Flash TTSはHume AIの音声デザインのベンチマークで1位(スコア71.4)となりました。また、Voice Arenaのリーダーボードでは、日本語やブラジルポルトガル語、ベトナム語など複数の言語で、両モデルが競合を抑えてトップクラスの順位を獲得しました。

安全対策

生成されたすべての音声には、AIが作ったことを示す電子透かし「SynthID」が入ります。声の再現には本人の同意を確認する仕組みがあり、来歴を記録するC2PAにも対応しています。

なお、声の再現機能は、米国のイリノイ州とテキサス州、欧州経済領域(EEA)、英国、スイス、インドでは利用できません。

使える場所

どちらのモデルも、Gemini APIとGoogle AI Studioで利用できます。Gemini Enterpriseにも近く対応する予定です。また、Flash TTSはGemini Notebookで、Flash-Lite TTSはGoogle Vidsで、すべての利用者が使えるようになっています。

CoAI編集部の視点

声の種類の多さに加え、文章で指示するだけで新しい声を作れる点が大きな特徴です。ナレーションや動画制作、音声アシスタントの開発など、音声を扱う幅広い用途で選択肢になりそうです。声の再現機能を使う場合は、利用できる地域と同意確認の手順を事前に確かめておきましょう。

出典

この記事で紹介したツール

ニュース一覧へ