PaddleOCR 소개 — 오픈소스 OCR의 선두주자

PaddleOCR 소개

스캔 문서·복잡한 PDF·다국어 이미지에서 글자를 뽑아야 할 때, OCR 라이브러리 선택이 결과를 좌우해요. PaddleOCR은 Baidu(바이두)의 파워드(PaddlePaddle) 프레임워크 기반 오픈소스 OCR 도구로, Umi-OCR·OmniParser·MinerU·RAGFlow 등 많은 유명 프로젝트에서 쓰이는 대표 선택이에요.

출처: https://paddlepaddle.github.io/PaddleOCR/main/index.html

3.x 핵심 능력

  • PaddleOCR-VL — 0.9B 초경량 비전-언어 모델로 다국어 문서 파싱. 109개 언어 지원.
  • PP-OCRv6 — 단일 모델로 50개 언어(중·영·일·46개 라틴계열). tiny/small/medium 3단계(1.5M~34.5M 파라미터).
  • PP-StructureV3 — PDF·이미지를 구조를 보존한 Markdown/JSON으로 변환.
  • PP-ChatOCRv4 — ERNIE 4.5를 통합한 지능형 정보 추출.

숫자로 보는 정확도

공식 발표 기준, PaddleOCR-VL-1.6은 OmniDocBench v1.6에서 96.3% 정확도로 SOTA를 찍었고, PP-OCRv6 medium은 PP-OCRv5_server 대비 인식 +5.1%·검출 +4.6%를 달성했어요. 큰 VLM(Qwen3-VL-235B 등)을 넘어서는 지표라 주목받았어요.

주의 — 3.x 인터페이스 변경

2.x로 작성한 코드는 3.x에서 그대로 돌아가지 않을 수 있어요. 사용 중인 문서 버전과 실제 PaddleOCR 버전을 반드시 맞춰 읽어야 해요.

더 알아보기