멀티모달 애플리케이션 만들기

멀티모달 애플리케이션 만들기

LlamaIndex는 언어 기반 애플리케이션뿐 아니라, 언어와 이미지를 함께 다루는 멀티모달(multi-modal) 애플리케이션도 만들 수 있게 해줘요. 이 영역은 아직 활발하게 탐구되고 있지만, 벌써 흥미로운 유스 케이스들이 등장하고 있어요.

출처: 공식문서

멀티모달 유스 케이스의 종류

RAG(검색 증강 생성)

RAG의 핵심 개념인 인덱싱, 검색, 합성은 모두 이미지 영역으로 확장될 수 있어요.

  • 입력은 텍스트일 수도, 이미지일 수도 있어요.
  • 저장된 지식 베이스는 텍스트나 이미지로 구성될 수 있어요.
  • 응답 생성의 입력도 텍스트나 이미지일 수 있어요.
  • 최종 응답도 텍스트나 이미지일 수 있어요.

구조화 출력(Structured Outputs)

새로운 OpenAI GPT4V를 LlamaIndex로 사용하면 structured 출력을 만들어낼 수 있어요. 사용자는 출력 구조를 정의하는 Pydantic 객체만 지정하면 되죠. 멀티모달 Pydantic 프로그램 가이드를 참고하세요.

검색 증강 이미지 캡셔닝

이미지를 이해하려면 지식 베이스에서 정보를 찾아야 할 때가 많아요. 여기 쓰이는 흐름이 검색 증강 이미지 캡셔닝이에요. 먼저 멀티모달 모델로 이미지를 캡셔닝한 뒤, 그 캡션을 텍스트 말뭉치에서 검색해 다듬는 방식이죠.

에이전트

GPT-4V로 에이전틱 기능을 보여주는 초기 작업들도 있어요. 멀티모달 에이전트와 GPT-4V 실험 노트북을 참고할 수 있어요.

평가와 비교

LLaVa-13, Fuyu-8B, MiniGPT-4 멀티모달 LLM 모델 비교

이미지 추론에 여러 멀티모달 LLM 모델을 어떻게 쓰는지 보여주는 노트북이에요. 모델 추론은 Replicate나 OpenAI GPT4-V API가 지원해요. GPT4-V, LLava-13B, Fuyu-8B, MiniGPT-4, CogVLM을 비교했어요.

멀티모달 RAG 단순 평가

멀티모달 RAG 시스템을 평가하는 방법을 보여주는 가이드예요. 텍스트 전용 사례처럼 리트리버(Retriever)와 제너레이터(Generator)를 각각 평가해요. 이 평가 기법들은 llama-index 라이브러리(평가 모듈)의 일부로 들어 있어요.

더 알아보기

다른 모델 프로바이더와 어떻게 연동하는지 궁금하다면 OpenAI·Replicate 멀티모달 가이드를 보면 좋아요. 핵심 RAG 개념을 이미지까지 확장해 보는 것도 멀티모달 감각을 잡는 좋은 출발점이에요.