PaddleOCR 소개 — 오픈소스 OCR의 선두주자
PaddleOCR 소개
스캔 문서·복잡한 PDF·다국어 이미지에서 글자를 뽑아야 할 때, OCR 라이브러리 선택이 결과를 좌우해요. PaddleOCR은 Baidu(바이두)의 파워드(PaddlePaddle) 프레임워크 기반 오픈소스 OCR 도구로, Umi-OCR·OmniParser·MinerU·RAGFlow 등 많은 유명 프로젝트에서 쓰이는 대표 선택이에요.
출처: https://paddlepaddle.github.io/PaddleOCR/main/index.html
3.x 핵심 능력
- PaddleOCR-VL — 0.9B 초경량 비전-언어 모델로 다국어 문서 파싱. 109개 언어 지원.
- PP-OCRv6 — 단일 모델로 50개 언어(중·영·일·46개 라틴계열). tiny/small/medium 3단계(1.5M~34.5M 파라미터).
- PP-StructureV3 — PDF·이미지를 구조를 보존한 Markdown/JSON으로 변환.
- PP-ChatOCRv4 — ERNIE 4.5를 통합한 지능형 정보 추출.
숫자로 보는 정확도
공식 발표 기준, PaddleOCR-VL-1.6은 OmniDocBench v1.6에서 96.3% 정확도로 SOTA를 찍었고, PP-OCRv6 medium은 PP-OCRv5_server 대비 인식 +5.1%·검출 +4.6%를 달성했어요. 큰 VLM(Qwen3-VL-235B 등)을 넘어서는 지표라 주목받았어요.
주의 — 3.x 인터페이스 변경
2.x로 작성한 코드는 3.x에서 그대로 돌아가지 않을 수 있어요. 사용 중인 문서 버전과 실제 PaddleOCR 버전을 반드시 맞춰 읽어야 해요.