ColPali 개요 — 시각 문서 검색 리트리버

ColPali 개요

ColPali(ColPali: Efficient Document Retrieval with Vision Language Models) 는 비전 언어 모델을 활용해 문서에 대한 효율적인 다중 벡터 임베딩을 '시각 공간'에서 만드는 문서 검색 기법입니다.

출처: ColPali — GitHub 저장소

핵심 아이디어

  • PaliGemma-3B 의 ViT 출력 패치를 선형 투영에 넣어 문서의 다중 벡터 표현을 만듭니다.
  • 복잡하고 깨지기 쉬운 레이아웃 인식과 OCR 파이프라인을 제거하고, 텍스트와 시각(레이아웃, 차트 등)을 한 모델로 함께 고려합니다.

포함된 모델

  • 원본 ColPali — ColBERT 아키텍처와 PaliGemma 모델 기반.
  • ColVision — 이후에 추가된 비전 리트리버 변형.
  • bi-encoder 리트리버 변형.

설정

Python >= 3.10, < 3.15 와 최신 PyTorch 와 호환됩니다.

pip install colpali-engine                    # PyPI
pip install git+https://github.com/illuin-tech/colpali   # 소스에서

더 알아보기