AI · 문서 OCR 2026년 읽기 8분

📄 Marker 2 공개! MinerU 대비 처리량 5배↑, olmOCR-bench 76.0점 — 문서 파서 시장의 판도를 바꿀까?

Marker 2, olmOCR-bench 76.0점 달성 — MinerU·Docling·LiteParse와 비교한 실측 정리

문서 한 줄을 잘못 변환하면 AI 검색 품질RAG(검색 증강 생성) 파이프라인 전체가 흔들립니다. 그래서 데이터랩(Datalab)이 공개한 오픈소스 문서 변환기 Marker 2의 성능이 업계에서 큰 관심을 모으고 있는데요. 이 글에서는 최신 벤치마크 결과와 경쟁 도구와의 차이를 알기 쉽게 정리합니다.

한 줄 요약: Marker 2는 Allen AI의 olmOCR-bench에서 전체 76.0%, 디지털 원본 PDF 83.5%를 기록했고, 같은 조건에서 MinerU 파이프라인(0.54 pg/s)보다 무려 5.4배 빠른 2.9 페이지/초를 꾸준히 뽑아냈습니다.

1. Marker 2란? 무엇이 달라졌나

Marker는 PDF, 이미지, PPTX, DOCX, XLSX, HTML, EPUB 같은 다양한 형식의 문서를 마크다운, JSON, HTML, 청크(chunk) 형태로 바꿔 주는 오픈소스 문서 변환 파이프라인입니다. 이번 버전 2는 지난 몇 달 동안 공개한 세 가지 핵심 모듈을 중심으로 처음부터 다시 만들었다고 합니다.

  • Surya OCR 2 — 데이터랩의 자체 개발 광학 문자 인식(OCR) 엔진
  • 레이아웃 모델 — 매개변수 2,000만 개 규모의 경량 문서 레이아웃 분석 모델
  • 새로운 pdftext — 기존 버전보다 3배 빠른 PDF 텍스트 추출기

VLM(비전-언어 모델)을 처음부터 끝까지 모든 페이지에 적용하는 다른 도구들과 달리, Marker는 파이프라인 구조를 유지합니다. PDF 안에 이미 들어 있는 PDF 텍스트 레이어를 우선 활용하고, 필요한 부분에만 OCR을 돌리는 방식이라 비용과 속도 면에서 큰 이점을 가집니다.

2. 세 가지 변환 모드 — balanced / fast / --disable_ocr

Marker 2의 가장 큰 변화는 단일 경로 대신 모드 3종을 선택할 수 있게 된 것입니다. 기본값은 실행 환경을 자동으로 감지해 정해지며, GPU에서는 balanced, CPU/MPS에서는 fast가 선택됩니다. --mode 옵션으로 강제 변경도 가능합니다.

① balanced — 품질 최우선

Surya VLM이 레이아웃을 판독하고, 내장 텍스트 품질이 낮을 때 페이지 전체에 OCR을 다시 수행합니다. olmOCR-bench에서 76.0%를 기록해 가장 정확도가 높습니다. GPU가 있는 환경에서 가장 잘 동작합니다.

② fast — 비용 효율형

경량 rf-detr/ONNX 레이아웃 감지기와 pdftext를 결합하고, VLM은 필요한 곳만 최소 호출합니다. 점수는 66.6%로 약간 낮지만, 7.4 페이지/초의 빠른 처리가 가능합니다.

③ --disable_ocr — CPU 전용 초경량

VLM 호출 없이 텍스트 레이어만 추출합니다. GPU도 추론 서버도 필요 없이 전부 CPU에서 실행되며, 점수는 43.6%, 처리량은 23.7 페이지/촀로 보고됐습니다.

3. 처리량 비밀 — 다중 CPU 워커가 추론 서버를 공유

Marker 2의 핵심 아키텍처 변화는 “다수의 경량 CPU 워커가 하나의 Surya 추론 서버를 공유한다”는 점입니다. 상위 프로세스(parent process)가 워커들 사이에 VLM 동시 처리 용량을 배분하므로, VRAM 크기가 아니라 서버 용량에 맞춰 처리량이 결정됩니다.

실측 비교: 같은 하드웨어에서 balanced 모드 단일 스트림은 약 0.3 페이지/초에 그치지만, 워커 풀을 활용한 동시 처리에서는 2.9 페이지/초를 안정적으로 유지합니다. — 데이터랩 측정 기준

4. 경쟁 도구와 실측 비교 (olmOCR-bench)

비교 평가는 Ai2의 공개 벤치마크 olmOCR-bench로 진행됐습니다. PDF 1,403개와 약 8,400개의 합격/불합격 단위 테스트로 구성되며, 수식·표 구조·읽기 순서·머리글·오래된 스캔 문서 등을 다룹니다. 전체 점수는 8개 범주의 매크로 평균으로 산출됩니다.

📊 Marker 2 vs MinerU vs Docling vs LiteParse

도구전체 점수디지털 원본 PDF처리량 (pg/s)
Marker 2 (balanced)76.0%83.5%2.9
Marker 2 (fast)66.6%7.4
Marker 2 (--disable_ocr)43.6%23.7
MinerU (pipeline)72.7%83.3%0.54
Docling50.3%64.0%2.1
LiteParse (CPU)22.4%1,721 (OCR off)

① Marker 2 vs MinerU

아키텍처가 가장 비슷한 두 도구입니다. 디지털 원본 PDF에서는 사실상 동률(83.5 vs 83.3)인데, 전체 점수와 처리량에서 모두 앞섭니다. 처리량 차이는 무려 5.4배입니다. MinerU는 VLM 백엔드도 제공하지만, 이는 모든 페이지에 VLM을 적용하는 경우로 별도 벤치마크가 필요합니다.

② Marker 2 vs Docling

GPU 파이프라인 중 격차가 가장 큽니다. 점수 76.0% vs 50.3%, 처리량 2.9 vs 2.1 pg/s로 모두 앞서네요. Docling의 강점은 정확도보다 거버넌스(MIT 라이선스)와 오디오·이메일 등 폭넓은 형식 지원입니다.

③ Marker 2 vs LiteParse

LiteParse는 Rust 기반 CPU 파서로, 속도를 극단적으로 추구해 OCR을 끄면 1,721 페이지/초를 기록합니다. 그러나 레이아웃 모델이 없어 비선형 구조 문서에서는 점수가 20.4%로 무너집니다. Marker의 CPU 모드(43.6%)와 비교하면 구조 보존력은 2배 이상 차이가 납니다.

5. 모드별 실패 양상 — 수식은 아직 어렵다

선택한 모드는 점수뿐 아니라 실패 양상도 바꿉니다. 가장 뚜렷한 약점은 수학(수식) 영역입니다. fast 모드는 수식에 VLM OCR을 적용하지 않고 PDF 텍스트 레이어에서 읽기 때문에 arXiv 수학 점수가 83.9에서 23.4로 떨어집니다. --disable_ocr는 이 범주에서 0.0점을 기록합니다.

두 수학 범주를 제외하면 오래된 스캔 문서가 모든 모드에서 가장 취약한 영역이며, 최고 점수도 43.2에 그칩니다.

6. 라이선스 — 상업적 사용 전 반드시 확인

상업용 도입을 고려한다면 라이선스 차이가 매우 큽니다.

  • Marker: 코드는 Apache 2.0, 모델 가중치는 OpenRAIL-M. 매출 500만 달러 미만은 무료, 초과 시 가중치 유료 라이선스 필요.
  • MinerU: Apache 2.0 + 추가 조건. MAU 1억 또는 월 매출 2,000만 달러 초과 시 상업 라이선스 필요.
  • Docling: MIT 라이선스(가장 자유로움), 모델은 각 패키지에서 별도 관리.
  • LiteParse: 오픈소스 + 유료 클라우드 LlamaParse 옵션.

7. 자주 묻는 질문 (FAQ)

Q1. Marker 2는 어떤 환경에서 가장 잘 작동하나요?

GPU가 있는 서버에서는 balanced 모드가 가장 높은 정확도(76.0%)를 보입니다. GPU가 없거나 비용이 민감한 환경에서는 fast 또는 --disable_ocr 모드가 적합하며, 후자는 추론 서버조차 필요 없습니다.

Q2. 기존 Marker 사용자는 어떻게 업그레이드하나요?

Python 3.10 이상이 필요합니다. 패키징 도구는 Poetry에서 uv로, 빌드 백엔드는 hatchling으로 바뀌었지만 pip install marker-pdf 명령은 그대로 사용 가능합니다. 단, 구조화 추출 변환기와 추출기는 제거됐고, 호스팅 API 또는 --use_llm 워크플로 사용을 권장합니다.

Q3. 전체 페이지 VLM(예: Gemini Flash 3.5)과 비교하면?

VLM은 최고 정확도를 자랑합니다. 같은 평가에서 데이터랩의 호스팅 VLM Chandra 2는 85.8점, Gemini Flash 3.5는 76.4점을 기록했습니다. Marker 2 balanced는 전체 점수에서 0.4점 차이까지 좁혔고, 디지털 원본 PDF에서는 83.5 대 79.1로 오히려 VLM을 능가했습니다 — API 비용 없이.

Q4. AI 검색(챗GPT·퍼플렉시티)에도 쓸 수 있나요?

네. 이 도구는 RAG 파이프라인에서 문서를 청크로 변환할 때 가장 많이 쓰입니다. 5배 처 리량 개선은 대량 문서 색인 구축 시간을 크게 줄여주며, CPU 모드 지원은 소규모 환경에서도 도입을 쉽게 만듭니다.

8. 핵심 용어 한눈에 보기

  • OCR(광학 문자 인식): 이미지로 된 글자를 기계 판독 가능한 텍스트로 변환하는 기술.
  • VLM(비전-언어 모델): 이미지와 텍스트를 함께 이해하는 멀티모달 AI 모델.
  • 문서 레이아웃 분석 모델: 열·표·그림·머리글 등 문서 구조를 자동 인식하는 모델.
  • 디지털 원본 PDF: 종이를 스캔한 것이 아니라 처음부터 디지털로 만들어진 PDF(텍스트 레이어 포함).
  • 처리량(Throughput): 단위 시간당 실제로 처리한 작업량. 여기서는 초당 페이지 수(pg/s).
  • 추론 서버: 학습된 AI 모델을 호스팅해 예측·생성 요청을 처리하는 서버.
  • VRAM(비디오 메모리): GPU 전용 고속 메모리로, 모델 가중치 보관에 사용.
  • 매크로 평균(Macro-average): 표본 수와 무관하게 모든 범주에 같은 가중치를 주는 평균 방식.
  • PDF 텍스트 레이어: PDF에 내장된 검색·복사 가능한 텍스트 데이터.
  • 벤치마크 하네스: 일관된 성능평가를 위한 테스트 코드·데이터·실행기 묶음.

9. 마무리 — 어떤 도구를 선택할까?

결론은 단순합니다. “점수만 보지 말고, 말뭉치·하드웨어·라이선스·출력 형식을 함께 보라.”

  • 대량 문서를 빠르게 색인하고 싶다면 → Marker 2 fast 또는 --disable_ocr
  • 최고 정확도가 필요하고 계산 자원이 있다면 → Marker 2 balanced 또는 VLM
  • MIT 라이선스 + 폭넓은 입력 형식이 필요하면 → Docling
  • 극한 속도, 단순 텍스트 추출만 필요하면 → LiteParse

데이터랩은 Marker 저장소의 공개 벤치마크 하네스에 경쟁사(MinerU, Docling, LiteParse) 실행기를 함께 제공합니다. 실제 운영 환경에서 직접 재현해 보는 것이 가장 현명한 선택이겠죠.