Jina AI, 초경량 시각 문서 파서 'jina-ocr-v1' 공개
Jina AI가 3.4B 파라미터(활성 570M)와 speculative decoding을 탑재한 시각 문서 파서 jina-ocr-v1을 발표했습니다. PDF, 스캔본, 표, 차트를 정제된 마크다운으로 변환하며 Hugging Face 및 Jina Reader에서 사용할 수 있습니다.
Jina AI가 2026년 9월 17일, 시각 문서 파서(Visual Document Parser) 모델인 'jina-ocr-v1'을 공식 발표했습니다. 이번 모델은 총 3.4B 파라미터 규모의 모델이지만, 효율적인 추론을 위해 570M의 활성 파라미터(Active Parameters)만을 사용하는 MoE(Mixture-of-Experts) 아키텍처를 채택했습니다.

이미지 출처: Jina AI (@JinaAI_)
jina-ocr-v1은 PDF, 스캔 문서, 표(tables), 차트, 영수증(invoices) 등 다양한 문서 형태를 입력받아 정제된 마크다운(clean markdown)으로 변환하여 출력하는 데 최적화되어 있습니다.
주요 특징 및 기술적 상세
이번 모델의 핵심 기술적 진보는 다음과 같습니다.
- 효율적인 아키텍처: 총 3.4B 파라미터 모델임에도 불구하고 실제 추론 시에는 570M의 파라미터만 활성화하여 빠른 처리 속도를 구현했습니다.
- Speculative Decoding: 모델의 추론 속도를 한층 더 높이기 위한 speculative decoding 메커니즘이 내장되어 있습니다.
- 다양한 문서 지원: 단순 텍스트를 넘어 표와 차트 등 문서 내 구조화된 데이터 추출에 강점이 있습니다.
사용 방법
jina-ocr-v1은 오픈 모델로 공개되어 개발자들이 즉시 활용 가능합니다.
- Hugging Face: 모델 허브(Model Hub)를 통해 전체 모델을 다운로드하여 로컬이나 클라우드 환경에 배포할 수 있습니다.
- Jina Reader API: Jina Reader의 API 옵션(
x-respond-with)을 통해 별도의 배포 과정 없이 API 호출 방식으로 즉시 통합하여 사용할 수 있습니다.
MoE 아키텍처의 특성상 활성 파라미터는 570M으로 가볍지만, 모델 전체 크기가 3.4B에 달하므로 로컬 환경에서 구동 시 충분한 메모리 요구사항을 고려해야 합니다.