LlamaIndex 멀티모달 검색 — Retriever와 Query Engine
LlamaIndex 멀티모달 검색 — Retriever와 Query Engine
이 예제는 텍스트·이미지를 함께 검색하는 멀티모달 RAG의 실전 흐름을 보여줘요.
파이프라인
- 텍스트·이미지 문서 로드.
- 멀티모달 인덱스로 텍스트/이미지 벡터 스토어 구성.
- Retriever로 텍스트·이미지 노드를 함께 검색.
- 멀티모달 LLM(예: GPT-4V)로 검색된 텍스트와 이미지를 합성해 응답.
검색 결합
retrieve_image_nodes=True 로 이미지 노드를 함께 검색해, 합성 단계에서 LLM이 image_documents 로 이미지를 직접 볼 수 있게 해요. 이렇게 텍스트와 이미지를 함께 넣는 것이 멀티모달 RAG의 핵심이에요.
실전 포인트
- 문서 레이아웃을 보존하려면 LlamaParse 같은 파서로 이미지·표를 추출.
- 커스텀 쿼리 엔진으로 텍스트+이미지 프롬프트를 조합해 응답 생성.
- 도표 밀도가 높은 데이터셋에서 텍스트 전용 대비 응답 정확도 향상을 확인할 수 있어요.