MinerU 소개 — 복잡한 문서를 LLM-ready 마크다운/JSON으로

MinerU 소개

과학 논문처럼 복잡한 레이아웃의 PDF에서 수식·표·그림까지 구조를 살려 뽑아내는 건 쉽지 않아요. MinerU는 OpenDataLab이 개발한 오픈소스 문서 파싱 엔진으로, PDF·이미지·DOCX·PPTX·XLSX·웹페이지를 구조화된 Markdown/JSON으로 변환해 LLM·RAG·에이전트 워크플로에 바로 쓰기 좋게 해요.

출처: https://github.com/opendatalab/MinerU

핵심 파싱 능력

  • PDF·이미지·DOCX·PPTX·XLSX 입력 지원.
  • 머리말·바닥글·각주·페이지 번호 제거로 의미적 연속성 확보.
  • 읽기 순서를 사람이 읽는 순서대로 복원(단일·다단·복잡 레이아웃).
  • 머리글·문단·목록 등 원본 구조 보존.
  • 수식 → LaTeX, 표 → HTML 변환.

이중 엔진

VLM + OCR 이중 엔진 구조로 109개 언어를 지원하고, 스캔 문서·손글씨·다단 레이아웃·교차 페이지 표 병합을 다룰 수 있어요. 언어 모델 사전학습(InternLM) 과정에서 탄생한 프로젝트라 과학 문헌 기호 변환에 강점을 가져요.

더 알아보기