Google เปิดตัวโมเดลสังเคราะห์เสียง (แปลงข้อความเป็นเสียงพูด หรือ TTS) ตัวใหม่ "Gemini 3.8 Flash TTS" และ "Gemini 3.8 Flash-Lite TTS" เมื่อวันที่ 23 กันยายน 2026 โดย Google วางตำแหน่งทั้งสองโมเดลให้เป็นโมเดลสร้างเสียงที่ถ่ายทอดอารมณ์ได้ดีที่สุดของบริษัท
ความแตกต่างของสองโมเดล
- Gemini 3.8 Flash TTS: สำหรับงานที่ต้องการการแสดงออกเป็นพิเศษ เช่น การกำกับรายละเอียดการพูดหรือการสร้างคาแรกเตอร์
- Gemini 3.8 Flash-Lite TTS: สำหรับงานที่ต้องการสร้างเสียงจำนวนมากด้วยต้นทุนต่ำ
ฟีเจอร์หลัก
- มีเสียงพร้อมใช้กว่า 2,000 เสียง
- รองรับกว่า 100 ภาษาและสำเนียงท้องถิ่น และสร้างเสียงใหม่ได้เพียงพิมพ์คำสั่งกำหนดบทบาท สำเนียง และลักษณะของเสียง
- สร้างเสียงเดียวกันขึ้นใหม่ได้จากตัวอย่างเสียงความยาว 30 วินาที
- กำหนดความเร็วในการพูด อารมณ์ ไปจนถึงเสียงประกอบที่ทำให้บทสนทนาฟังเป็นธรรมชาติได้ในแต่ละบทพูด
- น้ำเสียงคงที่แม้อ่านข้อความยาว และสร้างบทสนทนาระหว่างผู้พูด 2 คนได้
Google ระบุว่า Flash TTS ได้อันดับ 1 ในเบนช์มาร์กด้านการออกแบบเสียงของ Hume AI (คะแนน 71.4) นอกจากนี้ ในลีดเดอร์บอร์ดของ Voice Arena ทั้งสองโมเดลยังทำอันดับได้ในระดับแนวหน้าเหนือคู่แข่งในหลายภาษา เช่น ภาษาญี่ปุ่น ภาษาโปรตุเกสแบบบราซิล และภาษาเวียดนาม
มาตรการความปลอดภัย
เสียงทั้งหมดที่สร้างขึ้นจะฝังลายน้ำดิจิทัล "SynthID" ซึ่งระบุว่าสร้างโดย AI การโคลนเสียงมีกลไกยืนยันความยินยอมของเจ้าของเสียง และยังรองรับ C2PA ซึ่งใช้บันทึกที่มาของคอนเทนต์
ทั้งนี้ ฟีเจอร์โคลนเสียงยังไม่เปิดให้ใช้ในรัฐอิลลินอยส์และรัฐเท็กซัสของสหรัฐฯ เขตเศรษฐกิจยุโรป (EEA) สหราชอาณาจักร สวิตเซอร์แลนด์ และอินเดีย
ใช้งานได้ที่ไหน
ทั้งสองโมเดลใช้งานได้ผ่าน Gemini API และ Google AI Studio และมีกำหนดจะรองรับใน Gemini Enterprise เร็ว ๆ นี้ นอกจากนี้ ผู้ใช้ทุกคนยังใช้ Flash TTS ได้ใน Gemini Notebook และใช้ Flash-Lite TTS ได้ใน Google Vids แล้ว
มุมมองของกองบรรณาธิการ CoAI
นอกจากจำนวนเสียงที่มีให้เลือกมากแล้ว จุดเด่นสำคัญคือการสร้างเสียงใหม่ได้ด้วยคำสั่งข้อความเพียงอย่างเดียว จึงน่าจะเป็นอีกตัวเลือกสำหรับงานด้านเสียงที่หลากหลาย ตั้งแต่การบรรยาย การผลิตวิดีโอ ไปจนถึงการพัฒนาผู้ช่วยเสียง หากจะใช้ฟีเจอร์โคลนเสียง ควรตรวจสอบพื้นที่ที่ใช้งานได้และขั้นตอนการยืนยันความยินยอมไว้ล่วงหน้า