웹과 40여 종 문서를 단일 API로 스크래핑·마크다운 변환: Context.dev 'Scrape Anything'

웹페이지와 PDF, DOCX, PPT, XLSX 등 40여 종 문서 포맷을 URL 하나로 마크다운, HTML, JSON으로 변환하는 Context.dev 통합 스크래핑 API 'Scrape Anything'이 공개되었습니다. 봇 차단 자동 우회와 업무용 이메일 기준 월 1,000회 무료

tau · 2026년 9월 24일

#Context.dev #ScrapeAnything #웹스크래핑 #데이터추출 #마크다운변환 #개발도구 #API

웹과 40여 종 문서를 단일 API로 스크래핑·마크다운 변환: Context.dev 'Scrape Anything'

웹페이지 스크래핑과 각종 비정형 문서 파싱 작업을 단일 REST 엔드포인트로 통합하고, 복잡한 봇 차단 우회 및 자바스크립트 렌더링을 서버단에서 자동 처리하는 Context.dev의 통합 데이터 추출 API 'Scrape Anything'이 2026년 9월 23일 공개되었습니다.

Context.dev Scrape Anything 통합 스크래핑 API 구조 및 마크다운 변환 흐름도

이미지 출처: @mynameisyahia on X / Context.dev

LLM(대형 언어 모델) 애플리케이션과 RAG(검색 증강 생성) 파이프라인이 보편화되면서 외부 데이터를 수집하고 정제하는 스크래핑 파이프라인의 복잡성은 개발팀의 주요 기술 부채로 자리 잡았습니다. 웹 문서를 수집할 때는 헤드리스 브라우저와 안티봇 우회 인프라가 필요하고, PDF나 오피스 문서를 처리할 때는 별도의 파서 라이브러리를 유지보수해야 했습니다. Context.dev의 Scrape Anything은 이러한 분절된 파이프라인을 단일 URL 입력 엔드포인트로 통합하여 데이터 수집에 소모되는 글루 코드(glue code)를 대폭 제거하는 데 초점을 맞추었습니다.

웹페이지와 40여 종 문서 포맷을 단일 엔드포인트로 통합

Scrape Anything의 핵심 강점은 웹페이지는 물론 기업 환경에서 자주 쓰이는 40여 종의 다양한 비정형 문서 포맷을 동일한 인터페이스로 파싱할 수 있다는 점입니다.

개발자는 일반 웹사이트 URL 외에도 PDF, DOCX, DOC, XLSX, XLS, PPTX, PPT, CSV, XML, JSON, SVG 등 다양한 형식의 원본 파일 링크를 API에 그대로 전달할 수 있습니다. 수신된 문서는 LLM이 즉시 처리하기에 적합한 깃허브 마크다운(GitHub Flavored Markdown, GFM) 포맷으로 표준화되어 반환됩니다.

  • 스프레드시트 구조 보존: Excel 워크북(XLSX, XLS)은 시트별로 분리되어 각 시트 이름을 ## 헤딩으로 지정한 독립된 GFM 표(table) 형태로 변환됩니다. CSV 파일 역시 단일 GFM 테이블로 정돈됩니다.
  • 프레젠테이션 슬라이드 구조화: PowerPoint 파일(PPTX, PPT)은 ## Slide N: Title 형태의 슬라이드 단위 구조로 추출되며, 본문 텍스트와 표뿐만 아니라 발표자 노트(speaker notes)까지 체계적으로 보존됩니다.
  • 핵심 콘텐츠 자동 필터링: API 호출 시 useMainContentOnly: true 파라미터를 활성화하면 상단 내비게이션, 푸터, 사이드바 등 불필요한 크롬 요소를 자동으로 제거하고 실제 본문 데이터만 추출하여 토큰 소모를 줄여줍니다.
  • 다양한 출력 포맷: 기본 마크다운 외에도 원본 렌더링 HTML, 구조화된 JSON 데이터, 페이지 스크린샷 및 이미지 매니페스트 추출을 지원합니다.

서버사이드 안티봇 우회와 렌더링 파이프라인 자동화

일반적인 웹 스크래핑 작업에서 가장 많은 실패를 유발하는 영역은 클라우드플레어(Cloudflare), hCaptcha 등 진화한 봇 탐지 솔루션과 클라이언트 사이드 자바스크립트 렌더링 문제입니다.

Context.dev는 모든 렌더링과 방어벽 우회 작업을 서버 인프라단에서 완전 자동화했습니다. 요청이 인입되면 지능형 프록시 에스컬레이션 및 로테이션 풀을 가동하고, 헤드리스 브라우저 환경에서 동적 스크립트 실행, iframe 내부 콘텐츠 및 Shadow DOM 파싱을 마친 뒤 정제된 결과만 반환합니다. 일시적인 차단이나 네트워크 지연이 발생할 경우 서버 내부의 지수 백오프 재시도 로직이 자체적으로 대응합니다.

커뮤니티의 개별 사용자 피드백에서도 우회 사례가 공유되었습니다. X의 개발자 조이(@jsmillerdev)는 기존에 클라우드플레어 차단에 걸려 있던 약 130개 사이트를 대상으로 자체 테스트를 진행한 결과, Scrape Anything을 통해 95%를 수집할 수 있었으며 온보딩 1분 만에 API를 연동했다고 전했습니다.

엔드포인트 구성과 업무용 이메일 무료 티어 정책

Scrape Anything은 REST 아키텍처 기반의 직관적인 엔드포인트 세트를 제공하여 기존 시스템에 손쉽게 통합할 수 있습니다.

  • GET /web/scrape/markdown: 임의의 웹 URL 또는 지원 문서 링크를 입력받아 정제된 마크다운을 반환합니다.
  • GET /web/scrape/html: 자바스크립트가 완전히 실행된 최종 렌더링 HTML을 가져옵니다.
  • GET /web/scrape/images: 웹페이지에 포함된 이미지 에셋 목록을 매니페스트 형태로 추출합니다.
  • GET /web/scrape/sitemap: 특정 도메인의 사이트맵에 등록된 URL 목록을 수집합니다.
  • POST /web/crawl: maxPagesmaxDepth 한도를 지정하여 도메인 전체를 순회 수집하는 전용 크롤러를 구동합니다.

도입을 검토하는 엔지니어를 위한 무료 쿼터 정책도 함께 공개되었습니다. 업무용 이메일(기업 도메인 이메일)로 계정을 등록하면 매월 1,000회(1k reqs/mo)의 무료 API 호출 한도가 기본 부여됩니다.

다만 도입 시 주의해야 할 제약 사항도 존재합니다. 월 1,000회 무료 혜택은 일반 개인 이메일(Gmail 등) 가입자에게는 적용되지 않으며 반드시 기업 이메일 인증이 필요합니다. 또한 대규모 사이트 전체를 수집할 때는 단일 스크랩 엔드포인트 대신 전용 크롤링 엔드포인트(/web/crawl)와 사이트맵 옵션을 활용해야 하며, 세션 로그인이 강제되거나 복잡한 다단계 상호작용이 요구되는 폐쇄형 인트라넷 사이트의 경우 추가 커스텀 헤더 설정이 필요할 수 있습니다.

출처