구글, 음성 생성 모델 'Gemini 3.8 Flash TTS' 및 'Flash-Lite TTS' 공식 출시
구글이 자연어 프롬프트 기반 음성 설계와 Flash TTS의 30초 샘플 보이스 클로닝을 지원하는 차세대 음성 생성 모델 'Gemini 3.8 Flash TTS' 및 'Gemini 3.8 Flash-Lite TTS'를 공식 출시했습니다. Google AI Studio와 Gemini AP
2026년 9월 23일(현지 시각), 구글이 제미나이(Gemini) 모델 제품군에 차세대 고성능 음성 생성 모델인 'Gemini 3.8 Flash TTS'와 'Gemini 3.8 Flash-Lite TTS' 2종을 공식 출시했습니다. 이번 모델은 Google AI Studio와 Gemini API를 통해 프리뷰 형태로 개발자와 크리에이터에게 즉시 개방되었습니다.

이미지 출처: @GoogleAIStudio / Google
기존 텍스트 및 멀티모달 생성 역량을 넘어 오디오 합성 영역까지 확장된 이번 릴리스는 정교한 억양 및 악센트 제어, 자연어 프롬프트 기반 음성 생성, Flash TTS의 30초 보이스 클로닝 기능을 결합하여 인터랙티브 음성 에이전트, 오디오북, 게임 NPC 대화 등 다양한 실시간 음성 응용 프로그램 구축을 지원합니다.
자연어 음성 설계와 30초 동의 기반 보이스 클로닝
이번 Gemini 3.8 TTS 모델군의 핵심 기술 혁신은 사용자가 원하는 음성의 톤, 감정, 억양, 페르소나를 자연어 프롬프트로 서술해 즉석에서 새로운 음성을 생성하는 '보이스 디자인(Voice Design)' 기능입니다.
개발자는 사전에 정의된 2,000개 이상의 풍부한 프리셋 음성을 선택할 수 있을 뿐만 아니라, "차분하고 지적인 40대 다큐멘터리 내레이터 목소리"나 "밝고 에너지 넘치는 게임 안내자 톤"과 같이 프롬프트 텍스트만으로 고유한 캐릭터 음성을 세밀하게 연출할 수 있습니다.
또한 상위 모델인 Gemini 3.8 Flash TTS는 불과 30초 분량의 짧은 오디오 참조 샘플만으로 대상 화자의 음색과 운율을 정밀하게 복제하는 '보이스 클로닝(Voice Cloning)'을 제공합니다. 구글은 음성 합성 기술의 악용 및 무단 사칭을 방지하기 위해 음성 복제 파이프라인에 화자의 명시적 사전 동의 확인(Consent Check) 절차를 의무 적용했습니다.
Hume AI 벤치마크 1위와 Flash vs Flash-Lite 모델 라인업 차별화
구글 발표 자료에 따르면, 감정 음성 및 표현력 평가 전문 기관인 Hume AI의 'Voice Design Benchmark'에서 Gemini 3.8 Flash TTS가 종합 점수 71.4점으로 전체 1위를 기록했습니다. 특히 세부 평가 지표인 악센트 모델링(Accent Modeling) 항목에서는 60.8점을 획득하여 선두를 기록했습니다.
Hume AI의 종합 품질 지수(Overall Quality Index)에서도 Gemini 3.8 Flash TTS가 1위, 경량화 모델인 Gemini 3.8 Flash-Lite TTS가 2위를 각각 차지하며 모델 패밀리 전반에서 높은 합성 퀄리티를 나타냈습니다.
두 모델은 도입 목적과 시스템 요구 사항에 따라 명확히 구분됩니다:
- Gemini 3.8 Flash TTS: 최고 수준의 표현력과 30초 보이스 클로닝, 정밀한 억양 제어가 필요한 고품질 오디오 콘텐츠 제작, 버추얼 캐릭터, 오디오북, 인터랙티브 스토리텔링에 최적화된 풀스펙 모델입니다.
- Gemini 3.8 Flash-Lite TTS: 대규모 더빙, 오디오 콘텐츠 생성, 고용량 음성 에이전트에 최적화된 비용 효율적 경량 모델로, 톤과 템포의 세밀한 제어를 유지하면서도 뛰어난 처리 속도와 확장성을 제공합니다.
다국어 2인 대화 제어 지원과 도입 시 고려사항
Gemini 3.8 TTS 시리즈는 100개 이상의 다국어 음성 합성을 지원합니다. 단일 화자 음성 출력뿐만 아니라 팟캐스트, 인터뷰, 드라마 대본과 같이 두 명의 화자가 등장하는 복합 스크립트의 대화 턴(Turn-taking)과 감정 반응을 단일 API 호출 내에서 조율할 수 있는 '2인 화자 각본 연출 제어' 기능도 제공됩니다.
개발자는 Google AI Studio 웹 인터페이스에서 프롬프트 기반 음성 테스트 및 파라미터 조정을 수행할 수 있으며, 프로덕션 환경에서는 Gemini API(Interactions API / Speech Generation)를 통해 기존 백엔드 워크플로우에 직접 연동할 수 있습니다.
다만 현재 모델은 순차 배포 중인 프리뷰(Preview) 단계로 제공되므로, 계정 등급과 리전 인프라 상황에 따라 호출 할당량 및 가용성에 차이가 있을 수 있습니다. 아울러 프로덕션 배포 시에는 30초 음성 복제 기능에 요구되는 동의 확인 요건과 안전 정책 준수 여부를 사전 점검해야 합니다.