CoAI
ข่าว

Google เปิดตัว Gemini 3.8 Flash TTS มีเสียงให้เลือกกว่า 2,000 เสียง โคลนเสียงได้จากตัวอย่างเพียง 30 วินาที

Google เปิดตัวโมเดลสังเคราะห์เสียง (TTS) "Gemini 3.8 Flash TTS" และ "Gemini 3.8 Flash-Lite TTS" เมื่อวันที่ 23 กันยายน 2026 ใช้งานได้กว่า 2,000 เสียง สร้างเสียงใหม่ได้ด้วยคำสั่งข้อความ และสร้างเสียงเดิมขึ้นใหม่ได้จากเสียงตัวอย่างความยาว 30 วินาที

23 กันยายน 2569อ่านประมาณ 1 นาที

Google เปิดตัวโมเดลสังเคราะห์เสียง (แปลงข้อความเป็นเสียงพูด หรือ TTS) ตัวใหม่ "Gemini 3.8 Flash TTS" และ "Gemini 3.8 Flash-Lite TTS" เมื่อวันที่ 23 กันยายน 2026 โดย Google วางตำแหน่งทั้งสองโมเดลให้เป็นโมเดลสร้างเสียงที่ถ่ายทอดอารมณ์ได้ดีที่สุดของบริษัท

ความแตกต่างของสองโมเดล

  • Gemini 3.8 Flash TTS: สำหรับงานที่ต้องการการแสดงออกเป็นพิเศษ เช่น การกำกับรายละเอียดการพูดหรือการสร้างคาแรกเตอร์
  • Gemini 3.8 Flash-Lite TTS: สำหรับงานที่ต้องการสร้างเสียงจำนวนมากด้วยต้นทุนต่ำ

ฟีเจอร์หลัก

  • มีเสียงพร้อมใช้กว่า 2,000 เสียง
  • รองรับกว่า 100 ภาษาและสำเนียงท้องถิ่น และสร้างเสียงใหม่ได้เพียงพิมพ์คำสั่งกำหนดบทบาท สำเนียง และลักษณะของเสียง
  • สร้างเสียงเดียวกันขึ้นใหม่ได้จากตัวอย่างเสียงความยาว 30 วินาที
  • กำหนดความเร็วในการพูด อารมณ์ ไปจนถึงเสียงประกอบที่ทำให้บทสนทนาฟังเป็นธรรมชาติได้ในแต่ละบทพูด
  • น้ำเสียงคงที่แม้อ่านข้อความยาว และสร้างบทสนทนาระหว่างผู้พูด 2 คนได้

Google ระบุว่า Flash TTS ได้อันดับ 1 ในเบนช์มาร์กด้านการออกแบบเสียงของ Hume AI (คะแนน 71.4) นอกจากนี้ ในลีดเดอร์บอร์ดของ Voice Arena ทั้งสองโมเดลยังทำอันดับได้ในระดับแนวหน้าเหนือคู่แข่งในหลายภาษา เช่น ภาษาญี่ปุ่น ภาษาโปรตุเกสแบบบราซิล และภาษาเวียดนาม

มาตรการความปลอดภัย

เสียงทั้งหมดที่สร้างขึ้นจะฝังลายน้ำดิจิทัล "SynthID" ซึ่งระบุว่าสร้างโดย AI การโคลนเสียงมีกลไกยืนยันความยินยอมของเจ้าของเสียง และยังรองรับ C2PA ซึ่งใช้บันทึกที่มาของคอนเทนต์

ทั้งนี้ ฟีเจอร์โคลนเสียงยังไม่เปิดให้ใช้ในรัฐอิลลินอยส์และรัฐเท็กซัสของสหรัฐฯ เขตเศรษฐกิจยุโรป (EEA) สหราชอาณาจักร สวิตเซอร์แลนด์ และอินเดีย

ใช้งานได้ที่ไหน

ทั้งสองโมเดลใช้งานได้ผ่าน Gemini API และ Google AI Studio และมีกำหนดจะรองรับใน Gemini Enterprise เร็ว ๆ นี้ นอกจากนี้ ผู้ใช้ทุกคนยังใช้ Flash TTS ได้ใน Gemini Notebook และใช้ Flash-Lite TTS ได้ใน Google Vids แล้ว

มุมมองของกองบรรณาธิการ CoAI

นอกจากจำนวนเสียงที่มีให้เลือกมากแล้ว จุดเด่นสำคัญคือการสร้างเสียงใหม่ได้ด้วยคำสั่งข้อความเพียงอย่างเดียว จึงน่าจะเป็นอีกตัวเลือกสำหรับงานด้านเสียงที่หลากหลาย ตั้งแต่การบรรยาย การผลิตวิดีโอ ไปจนถึงการพัฒนาผู้ช่วยเสียง หากจะใช้ฟีเจอร์โคลนเสียง ควรตรวจสอบพื้นที่ที่ใช้งานได้และขั้นตอนการยืนยันความยินยอมไว้ล่วงหน้า

แหล่งที่มา

เครื่องมือที่กล่าวถึงในบทความนี้

กลับไปหน้าข่าว