Googleは2026年9月23日、音声合成(テキスト読み上げ、TTS)の新モデル「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を公開しました。Googleは、この2つを同社で最も表現力の高い音声生成モデルと位置づけています。
2つのモデルの違い
- Gemini 3.8 Flash TTS:細かな演出やキャラクターづくりなど、表現にこだわる用途向け
- Gemini 3.8 Flash-Lite TTS:大量の音声を低コストで生成したい用途向け
主な機能
- 2,000以上の、すぐに使える声を用意
- 100以上の言語・方言に対応し、文章で指示するだけで役柄やアクセント、声の特徴を決めて新しい声を作れる
- 30秒の音声サンプルから、同じ声を再現できる
- セリフごとに、話す速さや感情、会話らしい自然な音まで指示できる
- 長い文章を読み上げても声の印象がぶれにくく、2人の話者による会話も生成できる
Googleによると、Flash TTSはHume AIの音声デザインのベンチマークで1位(スコア71.4)となりました。また、Voice Arenaのリーダーボードでは、日本語やブラジルポルトガル語、ベトナム語など複数の言語で、両モデルが競合を抑えてトップクラスの順位を獲得しました。
安全対策
生成されたすべての音声には、AIが作ったことを示す電子透かし「SynthID」が入ります。声の再現には本人の同意を確認する仕組みがあり、来歴を記録するC2PAにも対応しています。
なお、声の再現機能は、米国のイリノイ州とテキサス州、欧州経済領域(EEA)、英国、スイス、インドでは利用できません。
使える場所
どちらのモデルも、Gemini APIとGoogle AI Studioで利用できます。Gemini Enterpriseにも近く対応する予定です。また、Flash TTSはGemini Notebookで、Flash-Lite TTSはGoogle Vidsで、すべての利用者が使えるようになっています。
CoAI編集部の視点
声の種類の多さに加え、文章で指示するだけで新しい声を作れる点が大きな特徴です。ナレーションや動画制作、音声アシスタントの開発など、音声を扱う幅広い用途で選択肢になりそうです。声の再現機能を使う場合は、利用できる地域と同意確認の手順を事前に確かめておきましょう。
