OmniVoice: 3초 오디오로 600개 이상 다국어 음성을 제로샷 복제하는 오픈소스 고속 TTS

샤오미 AI 랩 k2-fsa 팀이 3~10초 참조 음성으로 음색을 제로샷 복제하는 오픈소스 TTS 'OmniVoice'를 공개했습니다. 600개 이상 언어 지원, 실시간 대비 40배 생성 속도, Apache-2.0 상업 무료 라이선스를 갖춘 로컬 음성 복제 도구입니다.

tau · 2026년 9월 11일

#OmniVoice #VoiceCloning #TTS #OpenSource #DevTools #AI음성 #k2-fsa #ElevenLabsAlternative

OmniVoice: 3초 오디오로 600개 이상 다국어 음성을 제로샷 복제하는 오픈소스 고속 TTS

샤오미 AI 연구소 산하 음성 연구팀 k2-fsa(차세대 Kaldi 팀)가 3초에서 10초 분량의 참조 음성 오디오만으로 화자의 고유 음색과 발화 특성을 즉시 복제하여 임의의 텍스트를 낭독하는 오픈소스 음성 합성 모델 'OmniVoice(옴니보이스)'를 공개했습니다. 별도의 모델 사전 학습(파인튜닝) 없이 즉각 목소리를 복제하는 제로샷(Zero-Shot) 아키텍처를 기반으로 전 세계 600여 개 이상의 언어 및 방언을 지원하며, 실시간 대비 최대 40배 빠른 고속 생성 성능을 갖추었습니다.

3초 참조 음성으로 다국어 음성을 제로샷 복제하는 오픈소스 TTS 옴니보이스 소개 화면

이미지 출처: @NFTCPS on X / k2-fsa

그동안 고품질 음성 복제 기술은 고가의 상용 클라우드 API에 의존하거나, 오픈소스 라이브러리를 쓰더라도 수십 분 이상의 음성 데이터셋과 장시간의 GPU 학습을 거쳐야만 구현할 수 있었습니다. OmniVoice는 파이썬(Python) 기반 오픈소스 저장소(github.com/k2-fsa/OmniVoice)를 통해 Apache-2.0 라이선스로 코드와 모델 가중치를 전면 공개하여, 데이터 유출 위험 없는 로컬 환경에서 상업적 제약 없이 ElevenLabs 수준의 음성 복제를 구현할 수 있는 실질적인 대안을 제시합니다.

3~10초 참조 음성 기반 제로샷 음색 복제와 600여 개 다국어 지원

OmniVoice의 가장 핵심적인 기술적 강점은 극히 짧은 오디오 클립만으로 화자의 음색을 완전히 재현하는 제로샷 복제 능력입니다.

사용자가 평소 목소리로 녹음된 3~10초 분량의 음성 파일을 입력하면, 모델이 화자의 기저 주파수, 포먼트 특성, 고유한 발음 스타일을 즉각 파악하여 대상 목소리를 복원합니다. 번거로운 화자별 추가 학습 과정 없이 곧바로 원하는 텍스트를 입력해 해당 화자의 목소리로 오디오를 출력할 수 있습니다.

  • 파인튜닝 없는 즉시 복제: 사전 트레이닝 없이 참조 오디오 주입만으로 동작하므로 배포 및 실무 적용 단계의 파이프라인이 대폭 단순화됩니다.
  • 600여 개 언어 및 방언 커버리지: 단일 모델에서 주요 다국어뿐만 아니라 소수 언어 및 지역 방언까지 폭넓게 지원하여 글로벌 로컬라이제이션 콘텐츠 제작에 유연하게 대응합니다.
  • 교차 언어 발화 지원: 특정 언어로 녹음된 3초 음성 샘플만으로도 참조 화자가 구사하지 못하는 다른 외국어 텍스트를 동일한 음색으로 자연스럽게 발화할 수 있습니다.

실시간 대비 40배 생성 속도와 세부 음성 파라미터 제어

추론 처리 속도와 오디오 디테일 제어성 측면에서도 뛰어난 프로덕션 경쟁력을 확보했습니다.

OmniVoice는 오디오 1초 분량을 합성하는 데 필요한 연산 시간을 실시간 대비 최대 40배 단축했습니다. 긴 대본이나 다량의 나레이션을 대량 일괄 생성해야 하는 비디오 제작 환경에서 렌더링 대기 시간을 극적으로 단축할 수 있습니다.

단순히 속도만 빠른 것에 그치지 않고, 작업자가 원하는 연출 의도에 맞추어 세부 발화 파라미터를 조절할 수 있는 미세 제어 인터페이스를 제공합니다:

  • 연령(Age) 조절: 동일한 화자의 톤을 유지하면서 음성의 지각적 연령대를 높이거나 낮추어 캐릭터 특성을 부여할 수 있습니다.
  • 음고(Pitch) 제어: 기본 피치를 정밀하게 튜닝하여 발화 톤의 고저와 무드를 미세 조정합니다.
  • 방언(Dialect) 스타일링: 대상 언어 내의 세부 방언 억양을 반영하여 보다 사실적인 지역 음성을 구성합니다.
  • 기식음(Air/Breathiness) 조절: 호흡 소리와 공기감을 가감하여 친밀한 나레이션부터 건조한 안내 음성까지 다양한 질감을 연출합니다.

이러한 특성 덕분에 숏폼 영상 보이스오버, 글로벌 콘텐츠 더빙, 오디오북 제작, 인터랙티브 에이전트 구축 등 다양한 미디어 실무에서 강력한 저비용 고효율 도구로 기능합니다.

Apache-2.0 라이선스 활용성과 로컬 하드웨어 요구사항 및 윤리적 유의점

OmniVoice는 오픈소스 라이선스 정책과 인프라 운용 관점에서도 명확한 장점과 점검 사항을 동시에 갖추고 있습니다.

프로젝트는 상업적 이용이 허용되는 Apache-2.0 라이선스로 배포되었습니다. 기업이나 독립 개발자 모두 상용 솔루션의 매월 반복되는 과금 체계에서 벗어나, 자체 로컬 서버나 클라우드 인스턴스에 독립적인 음성 합성 엔진을 내재화할 수 있습니다.

다만 프로덕션 환경 도입 시 다음과 같은 실무적 제약 사항을 사전에 고려해야 합니다:

  • 깨끗한 참조 오디오 필수: 고품질 음색 복제 결과를 얻기 위해서는 배경 소음, 음악, 리버브(울림)가 배제된 깨끗한 3~10초 참조 음성을 확보해야 합니다.
  • 로컬 GPU 하드웨어 리소스: 고속 추론 성능을 최대로 끌어내거나 향후 데스크톱 앱(OmniVoice Studio)을 원활하게 구동하기 위해서는 적정 수준의 VRAM을 갖춘 GPU 환경이 권장됩니다.
  • 음성 도용 및 딥페이크 악용 방지: 정밀도가 뛰어난 음성 복제 기술의 특성상, 타인의 목소리를 동의 없이 무단 복제하여 보이스피싱이나 딥페이크 사기 등에 악용할 위험이 상존합니다. 따라서 기술을 활용하는 개발자와 제작자의 윤리적 가이드라인 준수 및 사용 권한 확인이 엄격히 요구됩니다.

출처

샤오미 k2-fsa 팀이 공개한 OmniVoice 오픈소스 저장소와 커뮤니티 발표 상세 내용은 공식 채널을 통해 확인하실 수 있습니다.