CoAI
뉴스

구글, 음성 합성 모델 'Gemini 3.8 Flash TTS' 공개… 2,000개 이상 목소리에 30초 음성으로 목소리 재현

구글이 2026년 9월 23일 음성 합성(TTS) 모델 Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS를 공개했습니다. 2,000개 이상의 목소리를 쓸 수 있고, 텍스트 지시로 새 목소리를 만들거나 30초 분량의 음성으로 목소리를 재현할 수 있습니다.

2026년 9월 23일약 1분 소요

구글이 2026년 9월 23일 음성 합성(텍스트 음성 변환, TTS) 신규 모델 Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS를 공개했습니다. 구글은 이 두 모델을 자사에서 가장 표현력이 뛰어난 음성 생성 모델로 내세우고 있습니다.

두 모델의 차이

  • Gemini 3.8 Flash TTS: 세밀한 연출이나 캐릭터 구현 등 표현력이 중요한 용도
  • Gemini 3.8 Flash-Lite TTS: 대량의 음성을 저렴하게 생성해야 하는 용도

주요 기능

  • 바로 쓸 수 있는 목소리 2,000개 이상 제공
  • 100개 이상의 언어·방언을 지원하며, 텍스트로 지시하기만 하면 배역, 억양, 목소리 특징을 정해 새 목소리를 만들 수 있음
  • 30초 분량의 음성 샘플로 같은 목소리를 재현할 수 있음
  • 대사마다 말하는 속도와 감정은 물론, 실제 대화 같은 자연스러운 소리까지 지정할 수 있음
  • 긴 글을 읽어도 목소리의 인상이 잘 흔들리지 않으며, 화자 2명의 대화도 생성할 수 있음

구글에 따르면 Flash TTS는 Hume AI의 음성 디자인 벤치마크에서 1위(점수 71.4)를 차지했습니다. 또한 Voice Arena 리더보드에서는 일본어, 브라질 포르투갈어, 베트남어 등 여러 언어에서 두 모델이 경쟁 모델을 제치고 최상위권에 올랐습니다.

안전장치

생성된 모든 음성에는 AI가 만들었음을 나타내는 디지털 워터마크 'SynthID'가 들어갑니다. 목소리 재현 기능에는 본인 동의를 확인하는 절차가 마련되어 있으며, 출처 이력을 기록하는 C2PA도 지원합니다.

참고로 목소리 재현 기능은 미국 일리노이주와 텍사스주, 유럽경제지역(EEA), 영국, 스위스, 인도에서는 이용할 수 없습니다.

사용할 수 있는 곳

두 모델 모두 Gemini API와 Google AI Studio에서 이용할 수 있으며, Gemini Enterprise에서도 곧 지원될 예정입니다. 또한 Flash TTS는 Gemini Notebook에서, Flash-Lite TTS는 Google Vids에서 모든 사용자가 쓸 수 있습니다.

CoAI 편집부의 시각

목소리 종류가 많은 데다 텍스트로 지시하기만 하면 새 목소리를 만들 수 있다는 점이 큰 특징입니다. 내레이션, 영상 제작, 음성 비서 개발 등 음성을 다루는 폭넓은 용도에서 선택지가 될 것으로 보입니다. 목소리 재현 기능을 쓰려면 이용 가능한 지역과 동의 확인 절차를 미리 확인해 두시기 바랍니다.

출처

이 글에서 소개한 도구

뉴스 목록으로