애플, Qwen3.5-9B 기반 문서 처리 VLM 'LensVLM-9B' 허깅페이스에 공개
애플이 허깅페이스에 오픈 모델 LensVLM-9B를 공개했습니다. Qwen3.5-9B 기반 파인튜닝 VLM으로, 긴 문서를 압축 이미지로 스캔한 뒤 관련 페이지만 선택적으로 확장해 토큰 소모를 줄입니다.
2026년 9월 24일, 애플(Apple)이 허깅페이스(Hugging Face) 공식 조직 계정(apple/LensVLM-9B)을 통해 신규 비전-언어 모델(VLM) 'LensVLM-9B'의 오픈 가중치를 전격 공개했습니다. 알리바바의 오픈 파운데이션 모델인 Qwen3.5-9B를 기반으로 파인튜닝된 이 모델은, 수십 페이지 분량의 문서를 처리할 때 발생하는 극심한 토큰 낭비를 해결하기 위해 저해상도 압축 페이지 이미지를 먼저 스캔하고 질의와 직결된 페이지만 동적으로 원본 해상도로 확장하는 계층적 추론 아키텍처를 도입했습니다.

이미지 출처: Hugging Face (apple/LensVLM-9B)
기존 멀티모달 모델을 실무 문서 분석에 도입할 때 가장 큰 장벽으로 지목되어 온 것은 '문서 길이 대비 입력 토큰 비용'이었습니다. 수십 페이지에서 수백 페이지에 달하는 PDF 보고서나 매뉴얼, 계약서를 고해상도 이미지 또는 전체 원문 텍스트로 인코딩할 경우 컨텍스트 윈도우가 빠르게 고갈되고 연산 지연시간이 급증합니다. 애플 연구진은 이 문제를 해결하기 위해 2단계 계층적 접근법을 모델 아키텍처에 구현했습니다.
압축 이미지 스캔과 동적 확장: 계층적 토큰 절약 메커니즘
LensVLM-9B의 핵심 작동 원리는 문서를 처음부터 전체 해상도로 읽지 않고, 압축된 저해상도 썸네일 이미지 형태로 전체 문서를 가볍게 훑는 데서 출발합니다.
문서 전체를 고해상도 토큰으로 전개하는 대신 저해상도 압축 페이지 이미지들을 입력으로 받아 대략적인 문서 구조, 레이아웃, 주요 섹션 위치를 파악합니다. 이 과정을 통해 전체 컨텍스트 입력에 소모되는 토큰 수를 획기적으로 절약할 수 있습니다.
사용자의 구체적인 질문이 주어지면, 모델은 사전 학습된 도구(learned tools)를 호출해 질문 해결에 필요한 핵심 페이지만을 정확히 식별합니다. 이후 해당 페이지만을 비압축 원본 형태나 상세 텍스트로 동적 확장(expand)하여 정밀한 읽기와 추론을 수행합니다.
이러한 메커니즘을 통해 모델은 전체 문서의 광범위한 맥락을 파악하면서도, 실제 추론에 필요한 연산 및 토큰 예산을 극적으로 감축할 수 있습니다.
Qwen3.5-9B 기반 파인튜닝과 오픈 가중치 배포의 의미
LensVLM-9B에서 주목할 또 다른 기술적 특징은 애플 자체 파운데이션 모델이 아닌 알리바바의 오픈소스 언어 모델인 Qwen3.5-9B를 베이스로 채택했다는 점입니다.
애플은 기존에도 연구 목적의 일부 오픈 가중치를 공개해 왔으나, 외부 오픈 생태계의 대표적 멀티모달 기반인 Qwen3.5 계열을 기반 모델로 삼아 실전적인 문서 특화 경량 VLM을 파인튜닝하고 이를 커뮤니티에 공개한 것은 의미 있는 협력적 움직임으로 평가받습니다.
9B 파라미터 규모는 엔터프라이즈 서버뿐 아니라 고성능 단일 워크스테이션이나 엣지 인프라에서도 실질적으로 운영 가능한 현실적인 크기입니다. 범용 거대 모델을 장문 문서 처리에 통째로 투입하는 것에 비해 서빙 인프라 비용을 크게 줄일 수 있는 대안으로 주목받고 있습니다.
배포 형태는 허깅페이스 표준 리포지토리를 통한 파이토치 및 허깅페이스 트랜스포머(Transformers) 호환 가중치 포맷입니다. 개발자들은 허깅페이스 허브에서 가중치를 내려받아 자체 파이프라인에 통합할 수 있습니다.
실무 적용 시 고려사항과 생태계 지원 현황
LensVLM-9B를 실무 환경에 도입할 때 확인해야 할 기술적 제약과 환경적 요소도 명확합니다.
현재 허깅페이스 리포지토리에 배포된 가중치는 표준 파이토치 기반 구조입니다. 맥OS 및 애플 실리콘 환경에서 네이티브 최적화 가속을 얻기 위한 공식 MLX 프레임워크 전용 가중치는 현재 배포 버전에 기본 포함되어 있지 않으므로, 로컬 온디바이스 배포를 계획하는 팀은 별도의 변환 및 최적화 과정을 점검해야 합니다.
또한 LensVLM-9B는 장문 문서의 구조적 파악과 선택적 페이지 확장에 고도로 특화된 아키텍처를 취하고 있습니다. 일반적인 단일 이미지 캡셔닝이나 개방형 비주얼 질의응답보다는 수십 페이지 분량의 PDF 분석, 기술 문서 검색, 양식 데이터 추출 등 문서 지능 워크플로우에 최적화된 모델이라는 점을 고려해 태스크를 설계해야 합니다.