Google merilis dua model sintesis suara (text-to-speech atau TTS) baru, "Gemini 3.8 Flash TTS" dan "Gemini 3.8 Flash-Lite TTS", pada 23 September 2026. Google memosisikan kedua model ini sebagai model pembuat suara paling ekspresif yang pernah mereka buat.
Perbedaan kedua model
- Gemini 3.8 Flash TTS: untuk kebutuhan yang menuntut ekspresi, seperti pengarahan detail atau pembentukan karakter
- Gemini 3.8 Flash-Lite TTS: untuk kebutuhan menghasilkan audio dalam jumlah besar dengan biaya rendah
Fitur utama
- Lebih dari 2.000 suara siap pakai
- Mendukung lebih dari 100 bahasa dan dialek; suara baru bisa dibuat hanya dengan instruksi teks yang menentukan peran, aksen, dan karakter suara
- Dapat mereplikasi suara yang sama dari sampel audio berdurasi 30 detik
- Kecepatan bicara, emosi, hingga bunyi alami khas percakapan bisa diatur untuk setiap baris dialog
- Karakter suara tetap konsisten saat membacakan teks panjang, dan bisa menghasilkan percakapan antara 2 pembicara
Menurut Google, Flash TTS menempati peringkat 1 di benchmark desain suara Hume AI (skor 71,4). Selain itu, di papan peringkat Voice Arena, kedua model meraih peringkat teratas dan mengungguli para pesaing di berbagai bahasa, termasuk bahasa Jepang, Portugis Brasil, dan Vietnam.
Langkah keamanan
Semua audio yang dihasilkan disisipi watermark digital "SynthID" yang menandakan bahwa audio tersebut dibuat oleh AI. Fitur kloning suara dilengkapi mekanisme untuk memastikan persetujuan pemilik suara, dan juga mendukung C2PA untuk mencatat asal-usul konten.
Perlu dicatat, fitur kloning suara tidak tersedia di negara bagian Illinois dan Texas di AS, Kawasan Ekonomi Eropa (EEA), Inggris, Swiss, dan India.
Di mana bisa digunakan
Kedua model tersedia di Gemini API dan Google AI Studio, dan akan segera hadir di Gemini Enterprise. Selain itu, Flash TTS kini bisa dipakai semua pengguna di Gemini Notebook, sedangkan Flash-Lite TTS di Google Vids.
Pandangan Redaksi CoAI
Selain banyaknya pilihan suara, keunggulan utamanya adalah kemampuan membuat suara baru cukup dengan instruksi teks. Model ini berpotensi menjadi pilihan untuk berbagai kebutuhan audio, mulai dari narasi, produksi video, hingga pengembangan asisten suara. Jika ingin memakai fitur kloning suara, pastikan terlebih dahulu wilayah yang didukung dan prosedur konfirmasi persetujuannya.