TAU-HOME.COM
LOADING

LlamaIndex, 문서 파싱 통합 API OpenDocRouter 출시

LlamaIndex가 문서 파싱 모델 10종을 하나의 API로 묶은 OpenDocRouter를 출시했습니다. 한 줄로 모델을 교체하고 ParseBench 점수로 품질과 비용을 비교하는 구조를 정리합니다.

tau · 2026년 10월 8일

#LlamaIndex #OpenDocRouter #문서파싱 #DocumentParsing #RAG

LlamaIndex, 문서 파싱 통합 API OpenDocRouter 출시

LlamaIndex가 2026년 10월 7일 공식 블로그 'Introducing OpenDocRouter: every document model under one API'를 통해 문서 파싱 통합 API인 OpenDocRouter 출시를 발표했습니다. 문서에서 마크다운(Markdown)을 뽑아내는 과정을 프론티어 모델과 오픈소스 모델 구분 없이 하나의 요청 형식으로 묶겠다는 것이 이번 발표의 핵심입니다.

여러 문서 페이지가 하나의 통합 API 파이프라인으로 모여 마크다운 출력을 만드는 과정을 표현한 추상 일러스트

이미지 출처: LlamaIndex

LlamaIndex는 발표에서 Hugging Face에 수천 개에 달하는 OCR 모델이 올라와 있고 프론티어 랩이 거의 매달 문서 읽기에 강한 신모델을 내놓는 상황을 출시 배경으로 들었습니다. 오늘 가장 좋은 파서가 다음 분기에도 가장 좋으리라는 보장이 없으니, 갈아타는 속도가 모델 선택 자체보다 중요하다는 것이 회사의 주장입니다.

한 줄 교체와 동일한 마크다운 출력

OpenDocRouter의 사용법은 LlamaIndex의 설명에 따르면 단순합니다. 동일한 요청 형식으로 모델 이름만 바꾸면 동일한 마크다운 출력 규격으로 결과를 받는다는 것입니다. 새 프롬프트를 짜거나 연동을 다시 만들 필요가 없다는 점이 출시 주장의 중심에 있습니다.

출시 시점 라인업은 프론티어와 오픈소스 10개 모델이며, LlamaIndex 공식 계정(@llama_index)이 직접 이름을 밝힌 5종은 Claude Opus 5.5, Gemini 3.8 Flash, GPT-6 Luna, MinerU2.5-Pro, PaddleOCR-VL-1.6입니다. 나머지 5종의 전체 명단은 이번에 확보된 공식 증거에 들어 있지 않아 확정적으로 적지 않습니다.

2차 보도인 Unite.AI에 따르면 각 실행은 버전화된 파싱 레시피(versioned parsing recipe) 하에서 동작합니다. 프롬프트·처리·설정을 묶은 레시피 단위로 실행이 고정된다는 의미이며, 모델을 바꿔도 호출 규격이 유지되는 구조로 이해할 수 있습니다.

ParseBench 점수와 layout 추적 출력

각 모델은 ParseBench에서 품질·비용 점수를 받습니다. 어떤 파서가 특정 문서에 적합한지 점수로 비교한 뒤 선택하라는 것이 LlamaIndex가 제시한 흐름입니다. 다만 점수 산정 방식이나 문서 유형별 세부 순위는 이번 증거 범위에 포함되지 않았습니다.

원본 트윗의 주장에 따르면 'layout: true' 옵션을 켜면 grounded bounding box가 포함된 추적 가능한 출력을 제공합니다. 어느 모델을 쓰더라도 위치 정보가 붙은 출력을 받을 수 있다는 취지이지만, 모델이 직접 지원하지 않는 경우의 내부 처리 방식은 공식 증거로 확인되지 않았으므로 단정하지 않습니다.

Python 라이브러리와 확인된 한계

PyPI에는 공식 Python 라이브러리 opendocrouter v1.0.0이 등록되어 있습니다. Python 3.9 이상을 지원하며, httpx 기반의 동기·비동기 클라이언트를 제공합니다. 설치 명령어나 인증 키 발급 절차, 호스팅 요금제는 이번 검증 범위에 들어 있지 않아 적지 않습니다.

확인된 한계도 분명합니다. 10종 전체 명단, 가격·과금 단위, 처리 가능한 파일 형식과 용량 상한, 동기·비동기 응답의 구체 조건은 이번에 확보된 공식 증거만으로 확정할 수 없습니다. 원본 트윗 본문이 중간에 잘려 있어 가격·가용성 문구도 공식 주장으로 싣지 않았습니다. 중국어 2차 매체가 전한 페이지당 단가와 최소 충전금 등은 공식 블로그 증거가 없어 이번 기사에서 제외했습니다.

문서 파싱을 RAG 파이프라인 앞단에 두는 팀이라면, 모델 교체 비용을 낮추는 인터페이스라는 점에서 지켜볼 만한 출시입니다. 다만 실제 도입 전에는 공식 블로그의 지원 모델 목록과 ParseBench 점수, Python 라이브러리 문서를 직접 확인하는 과정이 필요합니다.

출처