알리바바, Qwen-Audio-3.1 오디오 제품군 공개… ASR-Next·TTS-Next 추가 및 최대 95% 가격 인하

알리바바가 음성 인식·합성·상호작용·생성을 아우르는 Qwen-Audio-3.1 오디오 스택 5종을 공개했습니다. 신규 ASR-Next 및 TTS-Next 도입과 함께 ASR 최대 95%, Realtime 85%, TTS 70% 가격 인하를 단행했습니다.

tau · 2026년 9월 23일

#Qwen #Alibaba #QwenAudio #VoiceAI #TTS #ASR #Realtime

알리바바, Qwen-Audio-3.1 오디오 제품군 공개… ASR-Next·TTS-Next 추가 및 최대 95% 가격 인하

알리바바(Alibaba)의 Qwen 대형 모델 팀이 2026년 9월 23일, 음성 이해·생성·상호작용·창작을 포괄하는 차세대 오디오 모델 제품군인 'Qwen-Audio-3.1'을 공식 발표했습니다. 기존 ASR(음성 인식), TTS(음성 합성), Realtime(실시간 상호작용) 모델을 전면 개편하는 동시에 오디오 창작을 위한 신규 모델 'TTS-Next'와 심층 오디오 이해를 위한 'ASR-Next'를 새롭게 추가해 총 5종의 완성된 오디오 스택을 구축했습니다.

알리바바 Qwen-Audio-3.1 오디오 모델 제품군 공식 발표 인포그래픽

이미지 출처: @Alibaba_Qwen

이번 제품군 발표와 함께 알리바바는 오디오 모델 라인업 전반에 걸쳐 대대적인 API 가격 인하를 단행했습니다. 기존 서비스 대비 TTS는 약 70%, 실시간 음성 통화를 처리하는 Realtime은 약 85% 인하되었으며, 기본 ASR 모델은 최대 95%의 할인율을 적용해 음성 AI 인프라 도입 장벽을 크게 낮췄습니다.

5대 오디오 스택 구성: ASR·TTS 고도화와 신규 ASR-Next·TTS-Next

Qwen-Audio-3.1 제품군은 오디오의 이해(understanding), 생성(generation), 상호작용(interaction), 창작(creation)의 4개 핵심 영역을 5개 특화 모델로 세분화했습니다.

기존 파이프라인의 핵심인 ASR 모델은 다국어 및 지역 방언 인식 성능이 대폭 강화되었습니다. 특히 발화 중 불필요하게 섞이는 추임새(filler words)나 반복 어구를 자동으로 감지해 정리하는 자체 교정(native polishing) 기능이 탑재되어, 음성 녹취록을 한층 논리적이고 정제된 텍스트로 자동 변환합니다.

새롭게 추가된 'ASR-Next'는 단순한 음성-텍스트 변환을 넘어선 차세대 오디오 이해 아키텍처를 채택했습니다. 발화자의 화자 라벨링(speaker labels), 정밀 타임스탬프, 발화 정렬(aligned transcripts)을 지원하는 다중 화자 음성 인식을 구현했습니다. 아울러 음성 속 감정 분석뿐 아니라 주변 환경음, 기계 소음 등을 식별해 소리 캡셔닝(sound captioning), 음향 이벤트 위치 특정(event localization), 오디오 질의응답 및 추론(audio QA & reasoning)을 폭넓게 수행합니다.

음성 생성 축에서는 표준 TTS와 신규 TTS-Next가 역할을 분담합니다. 개선된 TTS는 다국어 및 방언 합성과 자연스러운 언어 간 음색 이전(cross-lingual voice transfer)을 지원하며, 텍스트 지시어(instruction)만으로 감정, 발화 속도, 스타일을 정밀하게 제어할 수 있습니다. 한편 신규 'TTS-Next'는 언어 모델(LM)과 확산 모델(Diffusion)을 통합한 프레임워크를 기반으로 설계되었습니다. 음성뿐 아니라 배경 효과음과 주변 음향을 단일 패스(one pass)로 일괄 생성하며, 다역할 음성 복제와 48kHz 스튜디오급 출력을 지원해 팟캐스트, 오디오북, 게임, 광고 음향 제작에 최적화되었습니다.

풀듀플렉스 실시간 대화 고도화: 다중 교사 증류와 감정 적응 상호작용

실시간 음성 상호작용을 담당하는 'Qwen-Audio-3.1-Realtime'은 실제 전화 통화처럼 사용자와 모델이 동시에 말하고 들을 수 있는 풀듀플렉스(Full-Duplex) 환경을 지원합니다. 기존 음성 비서의 턴테이킹 방식과 달리 대화 도중 사용자가 언제든지 말을 끊고 끼어들 수 있는 즉각적인 인터럽션(anytime interruption)을 구현했습니다.

기술적으로 Qwen-Audio-3.1-Realtime은 다중 교사 증류(multi-teacher distillation) 아키텍처를 기반으로 설계되었습니다. 이를 통해 실시간 상호작용 지연 시간을 낮추면서도 다음과 같은 핵심 상호작용 기능을 제공합니다:

  • 감정 이해 및 적응형 발화: 사용자의 음성 톤에서 침체된 기분이나 감정 변화를 감지하면, 모델이 스스로 발화 속도를 늦추고 공감형 톤으로 반응합니다.
  • 실시간 언어 전환: 대화 도중 언어가 변경되어도 끊김 없이 즉각적으로 언어를 감지해 대응합니다.
  • 대화 중 도구 호출(Tool Calls): 사용자와 실시간 음성 통화를 유지하면서도 백그라운드에서 필요한 도구나 함수를 호출해 요청을 처리할 수 있습니다.

최대 95% API 단가 인하 및 플랫폼 배포 현황

이번 릴리즈의 가장 즉각적인 영향은 음성 AI API의 전격적인 가격 인하입니다. 알리바바는 오디오 스택 전반에 걸쳐 파격적인 할인 요금을 공식 적용했습니다.

  • ASR(음성 인식): 기존 요금 대비 최대 95% 인하
  • Realtime(실시간 대화): 기존 요금 대비 약 85% 인하
  • TTS(음성 합성): 기존 요금 대비 약 70% 인하

배포 상태의 경우, 기본 인식 모델인 Qwen-Audio-3.1-ASR과 실시간 상호작용을 담당하는 Qwen-Audio-3.1-Realtime API는 알리바바 Qwen 클라우드 플랫폼(@qwen_cloud)에 즉시 등록되어 개발자 호출이 가능합니다.

반면 고도화된 음향 분석을 담당하는 신규 'ASR-Next' API는 현재 출시 예정(coming soon) 상태로 안내되었으며, TTS-Next 역시 순차적으로 클라우드에 연동될 예정입니다. 오픈소스 커뮤니티의 모델 가중치(weights) 공개 요청에 대해 알리바바는 발표 시점에서 별도의 오픈소스 배포 일정을 확정하지 않았으며, 클라우드 API 우선 공급 방식으로 운영을 시작했습니다.

출처