TAU-HOME.COM
LOADING

아티피셜 애널리시스, 음악 AI 벤치마크 'AA-Music v1.1' 공개… Suno v6 보컬·인스트루멘탈 1위

아티피셜 애널리시스가 17개 장르 1,000개 프롬프트와 37,000건의 블라인드 평가를 거친 AA-Music v1.1 벤치마크를 발표했습니다. Suno v6가 보컬과 인스트루멘탈 부문 1위를 모두 차지했습니다.

tau · 2026년 10월 8일

#AI음악 #ArtificialAnalysis #Suno #벤치마크 #생성형AI #음악생성

아티피셜 애널리시스, 음악 AI 벤치마크 'AA-Music v1.1' 공개… Suno v6 보컬·인스트루멘탈 1위

인공지능 모델 독립 벤치마크 기관인 아티피셜 애널리시스(Artificial Analysis)가 2026년 10월 8일, AI 음악 생성 모델을 정밀 평가하는 신규 벤치마크 'AA-Music v1.1'을 공식 출시했습니다. 17개 음악 장르에 걸친 1,000개의 신규 프롬프트와 37,000건 이상의 블라인드 인간 선호도 평가를 집계한 결과, 수노의 플래그십 모델인 Suno v6가 보컬과 인스트루멘탈(연주곡) 전 부문에서 1위를 차지했습니다.

Suno v6와 주요 AI 음악 모델 순위를 보여주는 Artificial Analysis AA-Music v1.1 벤치마크 리더보드

이미지 출처: Artificial Analysis (@ArtificialAnlys)

이번 평가는 음성 요소가 포함된 트랙을 다루는 'AA-Music-Vocal v1.1'과 순수 연주곡을 다루는 'AA-Music-Instrumental v1.1'의 두 개 독립 리더보드로 구성되었습니다. 최근 3개월간 주요 플래그십 음악 모델들이 대거 출시되며 단순한 멜로디 생성을 넘어 가사, 편곡, 보컬이 완결된 트랙을 생성하는 수준으로 품질이 상향 평준화됨에 따라, 미세한 완성도 차이를 가려내기 위한 정밀 평가 체계가 마련되었습니다.

17개 장르 1,000개 프롬프트와 37,000건의 블라인드 평가 체계

AA-Music v1.1의 가장 큰 특징은 음악 장르의 다양성과 실제 창작자들의 프롬프팅 패턴을 반영한 대규모 테스트 세트의 도입입니다.

평가 세트는 보컬과 인스트루멘탈 벤치마크에 각각 500개씩 배정된 총 1,000개의 신규 프롬프트로 구성되었습니다. 클래식과 재즈·블루스부터 EDM, 메탈, 레게, 팝, 힙합, 멤피스 소울, 락스테디 등에 이르기까지 17개 장르 전반에 걸쳐 균형 있게 선별되었습니다. 각 프롬프트는 단순 키워드 나열이 아니라 곡 구조, 분위기, 악기 편성, 보컬 톤과 믹싱 질감까지 구체적으로 지정하여 최신 음악 모델의 한계 성능을 테스트하도록 설계되었습니다.

  • 선발 평가단 블라인드 평가 100% 반영: 공식 리더보드 순위는 일반 사용자가 참여하는 공개 뮤직 아레나(Music Arena) 투표를 배제하고, 아티피셜 애널리시스가 사전 선발한 전문 평가단 패널의 블라인드 비교 투표만으로 산정됩니다.
  • 통계적 신뢰도 확보: 평가단은 동일 프롬프트로 생성된 두 트랙을 모델 정보 없이 청취한 뒤 선호 트랙을 선택했습니다. 전체 37,000건 이상(보컬 16,000건+, 인스트루멘탈 21,000건+)의 투표가 누적되었으며, 순위에 오른 모든 모델은 각 2,000건 이상의 개별 평가 표본을 확보했습니다.
  • 브래들리-테리 Elo 산정: 브래들리-테리 최대우도추정법(Bradley-Terry MLE)으로 점수를 계산하고 직관적인 Elo 척도로 환산했으며, 95% 신뢰구간을 함께 명시해 통계적 오차 범위를 투명하게 공개했습니다.

Suno v6 양대 리더보드 석권과 모델별 세부 순위

공개된 리더보드 결과에서는 수노(Suno)의 플래그십 모델인 Suno v6가 보컬과 인스트루멘탈 양쪽 모두에서 선두를 굳혔습니다.

보컬 리더보드(AA-Music-Vocal v1.1)에서 Suno v6는 Elo 1142점(95% 신뢰구간 1127~1157)을 기록하며 1위에 올랐습니다. 자사의 경량화 모델인 Suno v6-mini(Elo 1116점)를 26 Elo 차이로 앞서며 상위 1위와 2위를 수노 제품군이 독점했습니다. 인스트루멘탈 리더보드(AA-Music-Instrumental v1.1)에서도 Suno v6는 Elo 1140점을 획득해 Suno v6-mini(Elo 1109점)를 31 Elo 차이로 따돌리고 1위를 차지했습니다.

  • Mureka V9.5의 세대 간 도약: 뮤레카(Mureka) V9.5는 보컬 부문에서 Elo 1103점으로 3위에 안착했습니다. 이전 세대인 Mureka V9(Elo 1052점) 대비 51 Elo 점수가 상승하며, 보컬 리더보드 내 동일 모델 제품군 세대 교체 중 가장 큰 성능 향상 폭을 기록했습니다.
  • 인스트루멘탈 3~6위 초접전: 연주곡 부문에서는 Mureka V9(Elo 1081점), Mureka V9.5(Elo 1080점), Lyria 3 Pro(Elo 1078점) 및 Lyria 3.5(Elo 1076점)의 4개 모델이 불과 5 Elo 점수 격차 내에 밀집하며 통계적 동률을 나타냈습니다.
  • 일레븐 뮤직과 주요 모델 순위: Eleven Music v2.5는 보컬 7위(Elo 1012점), Eleven Music 기본형은 인스트루멘탈 7위(Elo 1021점)를 기록했습니다. 인스트루멘탈 부문에서는 Stable Audio 3 Large가 Elo 1017점으로 8위에 올랐습니다. 오픈 웨이트 모델 중에서는 MiniMax Music 3.0이 보컬 11위(기준 앵커 1000점), 인스트루멘탈 13위로 가장 높은 순위를 기록했습니다.

엔드투엔드 작곡 능력 검증과 창작 워크플로우 실무 고려사항

AA-Music v1.1 보컬 부문의 핵심적인 평가 기준 중 하나는 '가사 미제공(No lyrics supplied)' 조건입니다.

벤치마크 프롬프트에 텍스트 가사를 미리 제공하지 않음으로써, 모델이 음악적 스타일 지시문만을 기반으로 주제에 부합하는 가사를 작성하고, 멜로디를 붙이며, 보컬 화성과 세션 악기를 배치하는 전 과정을 엔드투엔드로 완결할 수 있는지를 직접 검증했습니다. 최근 출시된 플래그십 음악 모델들은 텍스트 한 줄로부터 완전한 곡 구조와 디테일한 악기 밸런스를 구현할 수 있게 되었습니다.

다만 상용 음악 제작 및 크리에이터 실무에서는 벤치마크 Elo 순위 외에도 몇 가지 현실적인 제약 요인을 함께 고려해야 합니다.

  • 선발 패널과 대중 취향의 분리: 이번 순위는 엄격한 평가 패널의 블라인드 비교만을 반영하므로, 대중적인 플랫폼 바이럴이나 특정 서브장르 커뮤니티의 체감 만족도와는 일부 차이가 있을 수 있습니다.
  • 비용과 라이선스 변수: 리더보드 최상위권 모델 간 품질 격차가 20~30 Elo 내외로 좁혀짐에 따라, 실제 프로덕션 워크플로우에서는 생성 품질 자체보다 완성 트랙당 API 과금 비용, 상업적 이용 및 저작권 라이선스 조항이 모델 채택의 핵심 결정 요인으로 부상하고 있습니다.
  • 장르별 성능 편차: 모델에 따라 팝과 EDM 등 현대적 전자음악에 강점을 보이는 구조가 있는 반면, 재즈나 소울 등 유기적인 라이브 세션 질감에서는 성능 차이가 발생할 수 있어 목적 장르에 맞춘 선별이 필요합니다.

출처