구글, 표현력 극대화한 'Gemini 3.8 Flash TTS' 및 'Flash-Lite TTS' 음성 모델 출시

구글이 100개 이상의 언어 지원과 2,000개 이상의 프리셋 음성, 문장별 연출 제어 및 실시간 톤 조절을 지원하는 Gemini 3.8 Flash TTS 및 Flash-Lite TTS를 공식 출시했습니다.

tau · 2026년 9월 24일

#Google #Gemini #TTS #AI음성 #GoogleAI

구글, 표현력 극대화한 'Gemini 3.8 Flash TTS' 및 'Flash-Lite TTS' 음성 모델 출시

구글(Google)이 2026년 9월 23일(현지 시각), Gemini 패밀리의 차세대 텍스트 음성 변환(TTS) 모델인 Gemini 3.8 Flash TTSGemini 3.8 Flash-Lite TTS 2종을 공식 발표했습니다. 기존 정적 음성 프리셋 방식에서 벗어나, 자연어 프롬프트를 통한 보이스 페르소나 설계와 실시간 발화 연출이 가능한 동적 오디오 스튜디오 환경을 제공하는 것이 핵심입니다.

구글 Gemini 3.8 Flash TTS 및 Flash-Lite TTS 공식 발표 그래픽과 음성 생성 인터페이스

이미지 출처: Google

이번 릴리즈는 창작자 중심의 고음질 연출을 위한 Flash TTS와 대규모 저지연 실시간 처리에 특화된 Flash-Lite TTS로 역할을 명확히 분리하여 출시되었습니다.

Flash TTS와 Flash-Lite TTS: 창작 연출과 실시간 확장의 이원화

구글은 워크플로우 요구사항에 맞춰 두 모델의 타깃과 제어 방식을 구분했습니다.

  • Gemini 3.8 Flash TTS (정밀 연출 및 캐릭터 디자인): 게임, 몰입형 오디오북, 팟캐스트, 인터랙티브 미디어 등 고음질 창작물 제작에 최적화되었습니다. 자연어 지시문을 통해 새로운 목소리를 설계할 수 있으며, 문장 단위(line-by-line)의 연출 지시, 발화 속도(pacing), 방언 전환(dialect shifts), 그리고 <laughs>|mhm| 같은 대화형 추임새(backchanneling), 한숨 및 감정 표현을 정밀하게 제어할 수 있습니다.
  • Gemini 3.8 Flash-Lite TTS (비용 효율 및 실시간 에이전트): 대규모 더빙, 대량 오디오 콘텐츠 생성, 실시간 음성 에이전트 구축에 초점을 맞추었습니다. AI가 상황에 맞춰 발화 톤과 속도를 실시간으로 자동 조절하도록 설계되어, 낮은 지연 시간과 높은 비용 효율성을 동시에 제공합니다.

두 모델 모두 장문 오디오 생성 시 음성 왜곡(glitch) 없이 일관된 톤을 유지하며, 단일 각본을 통한 2인 화자(dual-speaker) 대화에서 화자별 음성 분리와 자연스러운 턴테이킹(turn-taking)을 지원합니다.

2,000개 이상의 음성 라이브러리와 30초 음성 복제·보안 체계

기존 30여 개 수준이던 사전 제공 프리셋이 2,000개 이상의 프로덕션 레디 보이스로 대폭 확대되었으며, 100개 이상의 언어 및 방언을 지원합니다.

  • 자연어 보이스 설계 및 저장: 프롬프트만으로 독창적인 캐릭터 보이스나 브랜드 앰버서더 음성을 생성하고 프로필로 저장해 재사용할 수 있습니다.
  • Flash TTS 30초 음성 복제(Voice Replication): Flash TTS는 30초 분량의 명확한 음성 오디오 샘플과 음성 주체의 구두 동의 녹음을 대조·검증하여 대상 음성의 특징을 복제할 수 있습니다.
  • 보안 및 출처 인증: 음성 복제 시 화자 일치 여부를 판별하는 사전 동의 검증을 거치며, 생성된 모든 오디오에는 구글의 디지털 워터마킹 기술인 SynthID와 C2PA 디지털 출처 인증(provenance credentials)이 적용됩니다.

벤치마크 평가 및 지원 플랫폼 배포 현황

구글에 따르면, Gemini 3.8 Flash TTS와 Flash-Lite TTS는 흄 AI(Hume AI)의 종합 품질 지수(Overall Quality Index)에서 각각 1위와 2위를 기록했습니다. 블라인드 인간 선호도 평가인 Voice Arena에서도 일본어, 브라질 포르투갈어, 베트남어, 현대 표준 아랍어(MSA), 멕시코 스페인어, 힌디어 등 주요 글로벌 언어군 전반에서 경쟁 모델 대비 최상위권을 기록했다고 밝혔습니다.

두 모델은 발표 당일부터 개발자와 사용자를 위한 다양한 채널에 순차 배포됩니다.

  • 개발자: Google AI Studio 및 Gemini API를 통해 즉시 배포되어 사용할 수 있습니다.
  • 일반 사용자: 제미나이 노트북(Gemini Notebook, 구 NotebookLM)에는 Flash TTS가, 구글 비즈(Google Vids)에는 Flash-Lite TTS가 탑재되어 배포를 시작합니다.
  • 엔터프라이즈: 제미나이 엔터프라이즈(Gemini Enterprise) 환경에도 곧 두 모델이 모두 추가될 예정입니다.

출처