LlamaIndex 멀티모달 검색 — Retriever와 Query Engine

LlamaIndex 멀티모달 검색 — Retriever와 Query Engine

이 예제는 텍스트·이미지를 함께 검색하는 멀티모달 RAG의 실전 흐름을 보여줘요.

파이프라인

  1. 텍스트·이미지 문서 로드.
  2. 멀티모달 인덱스로 텍스트/이미지 벡터 스토어 구성.
  3. Retriever로 텍스트·이미지 노드를 함께 검색.
  4. 멀티모달 LLM(예: GPT-4V)로 검색된 텍스트와 이미지를 합성해 응답.

검색 결합

retrieve_image_nodes=True 로 이미지 노드를 함께 검색해, 합성 단계에서 LLM이 image_documents 로 이미지를 직접 볼 수 있게 해요. 이렇게 텍스트와 이미지를 함께 넣는 것이 멀티모달 RAG의 핵심이에요.

실전 포인트

  • 문서 레이아웃을 보존하려면 LlamaParse 같은 파서로 이미지·표를 추출.
  • 커스텀 쿼리 엔진으로 텍스트+이미지 프롬프트를 조합해 응답 생성.
  • 도표 밀도가 높은 데이터셋에서 텍스트 전용 대비 응답 정확도 향상을 확인할 수 있어요.

더 알아보기