ColPali 개요 — 시각 문서 검색 리트리버
ColPali 개요
ColPali(ColPali: Efficient Document Retrieval with Vision Language Models) 는 비전 언어 모델을 활용해 문서에 대한 효율적인 다중 벡터 임베딩을 '시각 공간'에서 만드는 문서 검색 기법입니다.
핵심 아이디어
- PaliGemma-3B 의 ViT 출력 패치를 선형 투영에 넣어 문서의 다중 벡터 표현을 만듭니다.
- 복잡하고 깨지기 쉬운 레이아웃 인식과 OCR 파이프라인을 제거하고, 텍스트와 시각(레이아웃, 차트 등)을 한 모델로 함께 고려합니다.
포함된 모델
- 원본 ColPali — ColBERT 아키텍처와 PaliGemma 모델 기반.
- ColVision — 이후에 추가된 비전 리트리버 변형.
- bi-encoder 리트리버 변형.
설정
Python >= 3.10, < 3.15 와 최신 PyTorch 와 호환됩니다.
pip install colpali-engine # PyPI
pip install git+https://github.com/illuin-tech/colpali # 소스에서