Multimodal RAG — 텍스트와 이미지를 함께 검색하기
Multimodal RAG
문서에는 텍스트뿐 아니라 차트·표·이미지 같은 시각 요소가 많아요. Multimodal RAG(멀티모달 RAG) 는 텍스트와 이미지를 모두 인덱싱·검색해, LLM이 합성 단계에서 텍스트와 이미지를 함께 받아 답하도록 하는 RAG 확장이에요. 전통 텍스트 RAG가 놓치는 도표 해석에서 환각을 크게 줄여요.
이 카테고리의 문서
- 개요: LlamaIndex 멀티모달 모델 — MultiModalVectorStoreIndex
- 핵심 기능: LangChain 멀티모달 유스케이스 — 텍스트+이미지 파이프라인
- 실전·API: LlamaIndex 멀티모달 검색 — Retriever와 Query Engine
출처: https://docs.llamaindex.ai/en/stable/module_guides/models/multi_modal.html