Voicebox: ElevenLabs와 Wispr Flow를 로컬로 대체하는 올인원 오픈소스 음성 스튜디오

음성 복제부터 실시간 받아쓰기, AI 코딩 에이전트용 MCP 연동까지 지원하는 완전 로컬 음성 스튜디오 Voicebox를 소개합니다. 7종 TTS 엔진과 23개 언어를 외부 데이터 전송 없이 무료로 제공합니다.

tau · 2026년 9월 10일

#Voicebox #TTS #음성복제 #WisprFlow #ElevenLabs #MCP #오픈소스 #개발도구

Voicebox: ElevenLabs와 Wispr Flow를 로컬로 대체하는 올인원 오픈소스 음성 스튜디오

개발자 Jamie Pine이 공개한 오픈소스 로컬 AI 음성 스튜디오 'Voicebox(GitHub: jamiepine/voicebox)'가 깃허브 스타 5.2만 개를 돌파하며 전 세계 오픈소스 커뮤니티의 뜨거운 주목을 받고 있습니다. MIT 라이선스로 배포되는 Voicebox는 클라우드 기반 음성 AI 서비스의 양대 축인 일레븐랩스(ElevenLabs)의 고품질 음성 합성·복제 기능과 위스퍼 플로우(Wispr Flow)의 실시간 음성 받아쓰기 기능을 단일 로컬 데스크톱 애플리케이션으로 결합한 올인원 스튜디오 도구입니다.

로컬 오픈소스 AI 음성 스튜디오 Voicebox의 7개 TTS 엔진 및 MCP 연동 인터페이스 화면

이미지 출처: Aircle|学生AIコミュニティ (@AiAircle34052) / Jamie Pine (Voicebox)

기존 상용 음성 AI 도구들은 사용자의 음성 데이터와 텍스트를 외부 클라우드 서버로 전송해야 하므로 프라이버시 침해 우려가 크고, 사용량에 따른 지속적인 구독 비용이 발생한다는 한계가 있었습니다. 반면 Voicebox는 모델 가중치 다운로드부터 추론, 음성 샘플 처리 및 마이크 녹음까지 전 과정을 사용자의 로컬 PC 내부에서 100% 완결하도록 설계되어 민감한 개인 정보와 음성 에셋의 유출을 원천 차단합니다.

ElevenLabs와 Wispr Flow를 하나로 통합한 완전 로컬 음성 아키텍처

Voicebox의 가장 두드러진 기술적 강점은 상용 클라우드 서비스에 분산되어 있던 음성 생성 파이프라인을 하나의 로컬 환경으로 일원화했다는 점입니다.

단 몇 초 분량의 참조 오디오 파일만 입력하면 화자의 고유한 음색과 억양, 발화 특징을 즉시 모사하는 제로샷(Zero-shot) 음성 복제를 제공합니다. 여기에 단축키 하나로 운영체제 어디서나 음성을 텍스트로 변환해 커서 위치에 바로 타이핑해 주는 전역 받아쓰기 기능이 결합되어 작업 효율성을 극대화합니다.

특히 실시간 받아쓰기 파이프라인에는 내장된 경량 로컬 Qwen3 언어 모델(0.6B~4B)이 연동되어 작동합니다. 발화자가 무의식중에 뱉는 "어...", "음...", "그..."와 같은 군더더기 말(filler words)을 로컬 LLM이 실시간으로 감지하여 깔끔하게 제거한 뒤 정제된 완성형 문장만을 입력창에 붙여넣어 주므로, 별도의 교정 작업 없이 곧바로 문서 작성과 코딩 프롬프트 작성에 활용할 수 있습니다.

7종 TTS 엔진 다변화와 제로샷 음성 복제 및 타임라인 편집기

Voicebox는 단일 합성 엔진에 묶여 있지 않고 다양한 오픈소스 음성 모델 생태계를 폭넓게 지원합니다. 사용자는 작업 목적과 타깃 언어에 맞추어 다음 7종의 신경망 TTS 엔진을 유연하게 교체하며 활용할 수 있습니다:

  • Qwen3-TTS 및 Qwen CustomVoice: 알리바바의 최신 다국어 음성 파운데이션 모델 기반 고품질 합성
  • LuxTTS: 가벼운 리소스 소비와 빠른 응답 속도를 자랑하는 실시간 생성 엔진
  • Chatterbox Multilingual 및 Chatterbox Turbo: 다국어 장문 대화 합성에 최적화된 고속 엔진
  • HumeAI TADA: 감정 표현과 억양 변화를 정교하게 제어할 수 있는 표현력 특화 엔진
  • Kokoro: 사전 정의된 영어·다국어 프리셋 환경에서 안정적인 낭독 음성을 제공하는 경량 엔진

총 23개 언어를 지원하며, 다중 화자 간의 자연스러운 대화를 구성할 수 있는 '스토리즈(Stories)' 타임라인 편집기를 탑재했습니다. 대화형 오디오북, 팟캐스트, 영상 더빙 작업 시 화자별 트랙을 시각적으로 배치하고 피치 시프트, 리버브, 딜레이, 코러스, 컴프레서 등 8종의 전문 오디오 후처리 이펙트를 즉시 적용할 수 있습니다. 또한 발화 전 텍스트에 캐릭터 페르소나를 부여해 말투를 자동으로 재작성하는 프롬프트 변환 기능도 로컬 LLM으로 구동됩니다.

Claude Code·Cursor용 MCP 서버 연동과 전역 핫키 실시간 받아쓰기

Voicebox가 AI 네이티브 개발자들의 워크플로우를 혁신하는 지점은 바로 표준 MCP(Model Context Protocol) 서버를 내장하고 있다는 사실입니다.

Voicebox는 로컬 환경에서 stdio 및 HTTP 전송 방식을 모두 지원하는 MCP 서버를 기본 제공합니다. 이를 통해 Claude Code, Cursor, Windsurf, VS Code 등 최신 AI 코딩 에이전트 환경과 손쉽게 연동할 수 있습니다.

  • 에이전트별 전용 보이스 프로필 바인딩: 각 AI 도구와 서브에이전트마다 고유한 복제 음성을 할당할 수 있습니다.
  • 음성 알림(Voice Notifications): 백그라운드에서 오랜 시간 소요되는 리팩토링, 테스트 스위트 실행, 대규모 코드베이스 분석 작업이 완료되었을 때 화면을 직접 확인하지 않고도 에이전트의 목소리로 작업 결과를 청각적으로 인지할 수 있습니다.

시스템 요구사항 측면에서는 복수의 신경망 모델과 로컬 LLM을 구동하므로, Apple Silicon(M시리즈 통합 메모리) Mac 또는 고용량 VRAM을 장착한 전용 외장 GPU 탑재 PC 환경이 권장됩니다. 또한 강력한 음성 복제 기능의 오남용(딥페이크, 사칭, 명의 도용)을 방지하기 위해 프로젝트 리포지토리 내에 '책임 있는 사용 가이드라인(RESPONSIBLE_USE.md)'이 포함되어 있으므로, 타인의 음성을 무단 복제하지 않는 등 윤리적 원칙을 철저히 준수해야 합니다.

출처