Nari Labs, 50ms TTFA·100만 자당 5달러 초고속 Qwen3-TTS 1.7B 엔드포인트 출시

Dia 개발사 Nari Labs가 독자 추론 엔진 기반 Qwen3-TTS 1.7B 엔드포인트를 출시했습니다. 50ms TTFA와 100만 자당 5달러 요금제, 실시간 음성 AI 워크플로우를 분석합니다.

tau · 2026년 9월 11일

#Qwen3-TTS #NariLabs #TTS #음성AI #오픈소스 #음성합성

Nari Labs, 50ms TTFA·100만 자당 5달러 초고속 Qwen3-TTS 1.7B 엔드포인트 출시

오픈소스 음성 대화 모델 Dia를 개발한 Nari Labs가 2026년 9월 11일, 독자적인 고성능 추론 엔진으로 구동되는 Qwen3-TTS 1.7B 전용 엔드포인트를 공식 출시했습니다. 첫 오디오 생성까지 걸리는 시간(Time-to-First-Audio, TTFA)을 50ms 수준으로 단축하고 100만 자당 5달러라는 파격적인 요금제를 제시하며 실시간 대화형 음성 AI 시장 공략에 나섰습니다.

Nari Labs의 Qwen3-TTS 1.7B 기반 실시간 음성 AI 엔드포인트 출시 공식 비주얼

이미지 출처: Toby Kim (@doyeob) / Nari Labs

Dia 모델을 통해 누적 200만 건 이상의 다운로드와 2만 개에 달하는 깃허브 스타를 기록했던 Nari Labs는 이번 릴리즈를 기점으로 단순 모델 배포를 넘어 고성능 상용 인프라 서비스 영역으로 포트폴리오를 확장했습니다.

자체 추론 엔진과 Qwen3-TTS 1.7B의 결합

이번 신규 엔드포인트의 핵심은 오픈소스 파운데이션 모델인 Qwen3-TTS 1.7B를 Nari Labs의 자체 추론 엔진에 최적화하여 탑재했다는 점입니다.

최근 오픈소스 진영의 음성 합성 모델들은 자연스러운 억양과 표현력 면에서 괄목할 성장을 이루었으나, 실시간 음성 에이전트에 필요한 초저지연 스트리밍 인프라를 직접 구축하는 데에는 높은 GPU 비용과 시스템 엔지니어링 장벽이 따랐습니다. Nari Labs는 자사의 경량화 추론 런타임을 결합하여 이 병목을 해결하고자 했습니다.

  • 표현력과 안정성 유지: 17억(1.7B) 파라미터 규모의 Qwen3-TTS 모델이 지닌 풍부한 음성 표현력과 억양 제어 능력을 온전히 보존했습니다.
  • 스트리밍 최적화: 텍스트 입력 즉시 첫 번째 오디오 패킷을 클라이언트로 전달하는 스트리밍 구조를 채택하여 대화 단절감을 최소화했습니다.

Nari Labs 측은 언어 모델뿐 아니라 멀티모달 음성 AI 영역에서도 오픈소스가 궁극적으로 승리할 것이라는 비전을 제시하며 이번 인프라 구축의 배경을 밝혔습니다.

초저지연 성능 벤치마크와 비용 구조의 실무적 함의

Nari Labs가 공개한 성능 지표에 따르면 신규 엔드포인트의 TTFA는 50ms에 달합니다.

개발사 측은 이를 두고 기존 초저지연 강자로 꼽히던 Cartesia 대비 약 5배 빠른 수준이며, ElevenLabs 등 기존 상용 서비스 대비 최대 10배 저렴한 100만 자당 5달러의 비용 구조를 실현했다고 강조했습니다. 다만 해당 50ms TTFA와 비교 수치는 Nari Labs 자체 환경에서 계측된 벤치마크 및 주장치이므로, 네트워크 환경과 실제 워크로드에 따른 외부 실측 검증이 요구됩니다.

  • 가격 정책과 상용화: 현재 공식 웹사이트(narilabs.com)를 통해 한시적 무료 체험 프로모션을 제공하고 있으며, 이후 100만 자당 5달러의 정규 종량 요금이 적용됩니다.
  • 개발 생태계 활용도: 실시간 고객 응대 봇, 실시간 동시통역, 인터랙티브 NPC 등 지연 시간에 극도로 민감한 프로덕션 서비스에서 진입 장벽을 낮추는 실질적인 대안이 될 것으로 기대됩니다.

출처