알리바바 Qwen, 모바일 특화 'Qwen Intelligence' 및 3대 모바일 에이전트 공개

알리바바 Qwen 팀이 스마트폰 환경에 특화된 모바일 AI 솔루션 'Qwen Intelligence'를 공개했습니다. 복합 작업 분해를 담당하는 Mobile Planner, API 우선과 GUI 폴백을 결합한 Mobile-Use, 3초 생성 속도의 Mobile Creative Agent

tau · 2026년 9월 24일

#Alibaba #Qwen #Qwen Intelligence #Mobile Agent #On-Device AI #Benchmark

알리바바 Qwen, 모바일 특화 'Qwen Intelligence' 및 3대 모바일 에이전트 공개

알리바바 Qwen 팀이 2026년 9월 23일(한국 시각 20시 50분), 스마트폰 환경에서 개인화된 지능을 구현하는 모바일 AI 솔루션 **'Qwen Intelligence'**를 공식 발표했습니다. 모바일 디바이스 환경에 맞춰 설계된 세 가지 특화 에이전트와 함께, 모바일 에이전트의 작업 계획·도구 실행·실기기 환경 성능·안전성을 객관적으로 평가할 수 있는 4개 벤치마크 스위트를 오픈소스로 공개했습니다.

알리바바 Qwen Intelligence 모바일 에이전트 및 벤치마크 아키텍처 공식 발표 그래픽

이미지 출처: @Alibaba_Qwen on X

스마트폰 인터페이스는 작은 화면 공간, 터치 기반 제스처, 빈번한 앱 전환, 엄격한 배터리 및 발열 제한, 간헐적인 네트워크 단절 등 데스크톱이나 클라우드 서버와는 질적으로 다른 제약을 가집니다. 기존 대규모 언어 모델(LLM)을 모바일 환경에 그대로 이식할 경우 추론 지연과 메모리 낭비로 인해 실용적인 에이전트 구동이 어려웠습니다. 알리바바가 이번에 공개한 Qwen Intelligence는 온디바이스 추론 효율성과 에이전트 하네스(harness)를 결합하여, 기기 내에서 실행 가능한 고유한 모바일 에이전트 프레임워크를 제공합니다.

3대 특화 에이전트: 플래너·모바일 유즈·크리에이티브 아키텍처

Qwen Intelligence는 스마트폰의 제한된 연산 자원과 복합적인 모바일 UX 특성을 고려해, 단일 거대 모델이 모든 작업을 전담하는 방식 대신 세 가지 독립된 전문 에이전트로 역할을 분할했습니다.

  • Mobile Planner Agent (모바일 플래너 에이전트): 복잡한 다단계 사용자 요청을 자율적으로 분해하고 전체 실행 경로를 조율합니다. '모델과 하네스의 공진화(Model x Harness co-evolution)' 구조를 채택해, 모델은 고수준 의미 이해와 의사결정에 집중하고 런타임 하네스가 시스템 상태·메모리·도구 관리 및 실행 피드백 루프를 전담합니다. 특히 작업 단위로 동적 갱신되는 작업 메모리(Working Memory)와 개인화 정보를 안전하게 관리하는 장기 메모리(Long-term Memory), 복합 문제 해결을 위한 서브에이전트 디스패치(Subagent Dispatch) 메커니즘을 내장했습니다. 벤치마크 평가 결과 MobilePA-Bench에서 종합 1위 및 비즈니스·메모리 부문 1위를 달성했습니다.
  • Mobile-Use Agent (모바일 유즈 에이전트): 디바이스 내 실제 도구 및 앱 제어를 담당하며 'API 우선과 GUI 폴백(API-first with GUI fallback)' 하이브리드 실행 모델을 채택했습니다. MCP(Model Context Protocol), DeepLink, CLI 등 시스템 및 애플리케이션 API가 지원되는 환경에서는 최단 경로로 직접 API를 호출해 지연 시간과 토큰 소모를 줄이고, 전용 API가 없는 인터페이스에서는 비전 기반 GUI 조작으로 자동 전환해 작업을 완수합니다. 불법·고위험 작업 차단, 결제·데이터 삭제 등 핵심 의사결정에 대한 사용자 확인, 플랫폼 정책 준수로 구성된 3단계 안전 제어 체계를 갖추었으며, 주요 벤치마크에서는 MobileWorld 82.1점, MobileWorld-Real 92.2점, AndroidDaily 97.2점을 기록하며 90%의 엔드투엔드 작업 성공률을 달성했습니다.
  • Mobile Creative Agent (모바일 크리에이티브 에이전트): 단 한 줄의 자연어 프롬프트로부터 이미지 생성 및 스타일 변환, 크리에이티브 편집을 온디바이스에서 즉각 수행합니다. 알리바바 자체 측정에 따르면 기기 온디바이스 연산만으로 약 3초 만에 이미지를 생성할 수 있으며, 동급 주요 모델 대비 약 2배 빠른 생성 속도를 기록했다고 밝혔습니다.

4대 오픈 벤치마크 스위트 공개와 엔드투엔드 성능 검증

모바일 에이전트는 기존 정적 텍스트 벤치마크나 웹 브라우징 테스트로는 평가할 수 없는 독특한 실패 모드를 가집니다. 알리바바 Qwen 팀은 모바일 에이전트의 실질적 효용성을 검증하기 위해 4개 벤치마크를 함께 오픈소스로 공개했습니다.

  1. MobilePA-Bench: 13개 기능 도메인과 212개 실전 도구를 결합한 1,705개 평가 태스크로 구성되어 장기 메모리 지속성, 서브에이전트 핸드오프, 복합 계획 수립 능력을 종합 검증합니다. Qwen 팀의 Mobile Planner Agent가 이 벤치마크 종합 1위 및 비즈니스·메모리 부문 1위를 기록했습니다.
  2. MobileWorld: 100개 이상의 다양한 환경(앱)과 2,000개 이상의 태스크를 기반으로, 시뮬레이션 환경 및 실제 애플리케이션 전반에서 API 및 GUI 실행 능력을 종합 평가합니다.
  3. MobileWorld-Real: 시뮬레이터가 아닌 실제 물리 기기 환경에서 104개 모바일 애플리케이션을 대상으로, 실제 디바이스 상에서의 에이전트 실행력과 종단간(End-to-End) 성능을 검증합니다.
  4. MobileWorld-Safety: 복단대학교 바이쩌(BaiZe) 보안 연구팀과 공동 구축한 안전성 평가 벤치마크로, 모바일 환경의 위험 시나리오에서 에이전트의 안전한 행동과 방어 가드레일을 종합 검증합니다.

상용 하드웨어 탑재 일정과 검증 과제

알리바바는 Qwen Intelligence를 연구용 벤치마크에 머무르지 않고 실제 상용 스마트폰 생태계에 직결하고 있습니다.

첫 번째 상용 파트너로는 스마트폰 제조사 아너(HONOR)가 확정되었습니다. Qwen Intelligence 솔루션은 2026년 9월 28일 공식 출시 예정인 아너의 플래그십 라인업 '매직 9(Magic9)' 시리즈와 로봇 폰(Robot Phone)에 최초 탑재될 예정입니다.

다만 도입 과정에서 몇 가지 실무적 고려 사항과 한계점이 존재합니다. 공개된 벤치마크 환경(GitHub, 공식 리더보드)과 Qwen-UI-Agent 기술 보고서(arXiv:2607.28227)는 리서치 커뮤니티에 공개되었으나, 실제 스마트폰 칩셋에 최적화된 온디바이스 모델 바이너리 및 상용 런타임 코드베이스 전체의 일반 공개 일정과 오픈소스 라이선스 범위는 이번 발표에서 완전히 공표되지 않았습니다. 또한 MobilePA-Bench 및 MobileWorld 점수와 3초 생성 속도는 Qwen 팀의 자체 측정 기준이므로, 다양한 서드파티 칩셋 및 하드웨어 환경 전반에서의 객관적 재현성 검증이 필요합니다.

핵심 요약 및 리소스

  • 공개 구성: Qwen Intelligence 모바일 프레임워크 (Mobile Planner, Mobile-Use, Mobile Creative 에이전트)
  • 공개 벤치마크: MobilePA-Bench, MobileWorld, MobileWorld-Real, MobileWorld-Safety
  • 하드웨어 파트너: 아너(HONOR) Magic9 시리즈 및 Robot Phone 탑재 (2026년 9월 28일 출시 예정)
  • 공식 리포지토리: Tongyi-MAI/MobileWorld GitHub
  • 공식 리더보드: MobileWorld Leaderboard
  • 기술 보고서(Qwen-UI-Agent / Mobile-Use): arXiv:2607.28227

출처