Ngày 23 tháng 9 năm 2026, Google ra mắt hai mô hình tổng hợp giọng nói (chuyển văn bản thành giọng nói, TTS) mới là "Gemini 3.8 Flash TTS" và "Gemini 3.8 Flash-Lite TTS". Google định vị cả hai là những mô hình tạo giọng nói giàu biểu cảm nhất của mình.
Khác biệt giữa hai mô hình
- Gemini 3.8 Flash TTS: dành cho các nhu cầu đòi hỏi biểu cảm cao, như dàn dựng chi tiết hay xây dựng nhân vật
- Gemini 3.8 Flash-Lite TTS: dành cho các nhu cầu cần tạo lượng lớn âm thanh với chi phí thấp
Tính năng chính
- Hơn 2.000 giọng dựng sẵn, dùng được ngay
- Hỗ trợ hơn 100 ngôn ngữ và phương ngữ; chỉ cần mô tả bằng văn bản là có thể tạo giọng mới với vai diễn, giọng vùng miền và đặc điểm giọng theo ý muốn
- Tái tạo cùng một giọng nói từ mẫu âm thanh dài 30 giây
- Điều chỉnh tốc độ nói, cảm xúc, thậm chí cả những âm thanh tự nhiên đặc trưng của hội thoại cho từng câu thoại
- Giữ giọng ổn định khi đọc văn bản dài và có thể tạo hội thoại giữa 2 người nói
Theo Google, Flash TTS đứng hạng 1 trên benchmark thiết kế giọng nói của Hume AI (71,4 điểm). Ngoài ra, trên bảng xếp hạng Voice Arena, cả hai mô hình đều giành thứ hạng hàng đầu, vượt qua các đối thủ ở nhiều ngôn ngữ như tiếng Nhật, tiếng Bồ Đào Nha (Brazil) và tiếng Việt.
Biện pháp an toàn
Mọi đoạn âm thanh được tạo ra đều được gắn thủy vân số "SynthID" cho biết nội dung do AI tạo. Tính năng nhân bản giọng có cơ chế xác nhận sự đồng ý của chính chủ, đồng thời hỗ trợ chuẩn C2PA để ghi lại nguồn gốc nội dung.
Lưu ý, tính năng nhân bản giọng hiện không khả dụng tại các bang Illinois và Texas của Mỹ, Khu vực Kinh tế Châu Âu (EEA), Vương quốc Anh, Thụy Sĩ và Ấn Độ.
Có thể dùng ở đâu
Cả hai mô hình đều có trên Gemini API và Google AI Studio, và sẽ sớm có mặt trên Gemini Enterprise. Ngoài ra, mọi người dùng đều đã có thể dùng Flash TTS trong Gemini Notebook và Flash-Lite TTS trong Google Vids.
Góc nhìn của ban biên tập CoAI
Bên cạnh kho giọng phong phú, điểm nổi bật là khả năng tạo giọng mới chỉ bằng mô tả văn bản. Đây có thể là một lựa chọn đáng cân nhắc cho nhiều nhu cầu liên quan đến âm thanh, từ lồng tiếng thuyết minh, sản xuất video đến phát triển trợ lý giọng nói. Nếu định dùng tính năng nhân bản giọng, hãy kiểm tra trước khu vực được hỗ trợ và quy trình xác nhận sự đồng ý.