LangChain 멀티모달 — 텍스트+이미지 RAG 유스케이스
LangChain 멀티모달 — 텍스트+이미지 RAG 유스케이스
LangChain은 멀티모달 입력을 다루는 공식 유스케이스 가이드를 제공해요. 이미지를 텍스트로 변환해 기존 RAG 파이프라인에 통합하는 전형적 접근을 보여줘요.
두 가지 접근
- 이미지 → 텍스트: 멀티모달 LLM으로 이미지를 캡션·요약해 텍스트 인덱스에 넣는 방식. 단순하고 널리 쓰여요.
- 이미지 원본 유지: 문서에 이미지 자체를 임베딩·보존하는 방식. 더 정확하지만 인프라가 무거워요.
실전 흐름
텍스트와 변환된 이미지 설명을 함께 청킹·임베딩하고, 검색 결과를 LLM에 넣어 질문에 답해요. 도표가 많은 문서에서 텍스트만 쓸 때보다 응답 품질이 크게 올라가요.
활용 포인트
- 차트·표·다이어그램이 흔한 금융·법률·기술 문서에 유용.
- 캡션 생성 방식을 선택해 비용과 정확도의 균형을 맞춰요.