LlamaIndex 멀티모달 모델 — 다중 벡터 스토어 인덱스

LlamaIndex 멀티모달 모델 — 다중 벡터 스토어 인덱스

LlamaIndex의 MultiModalVectorStoreIndex 는 텍스트와 이미지를 별도의 벡터 스토어에 나눠 인덱싱하는 멀티모달 RAG의 핵심이에요.

구성

텍스트 벡터 스토어와 이미지 벡터 스토어를 준비해 스토리지 컨텍스트로 구성하고, 텍스트·이미지 문서를 함께 로드해 인덱스를 만들어요.

index = MultiModalVectorStoreIndex.from_documents(
    documents, storage_context=storage_context,
)

검색·질의

index.as_retriever(similarity_top_k=3, image_similarity_top_k=3) 로 텍스트와 이미지를 함께 검색하고, SimpleMultiModalQueryEngine 로 GPT-4V 같은 멀티모달 LLM에 질의해요. 텍스트-텍스트, 이미지-이미지 검색과 랭킹 퓨전도 지원해요.

확장

GPT-4V, Anthropic(Opus·Sonnet), Gemini, LLaVA 등 다양한 멀티모달 LLM과 통합되며, Qdrant·Weaviate 등 멀티모달 벡터 스토어를 지원해요.

더 알아보기