개요 (Visual Instruction Tuning)

개요 (Visual Instruction Tuning)

LLaVA(Large Language and Vision Assistant)는 이미지와 텍스트를 함께 다루는 멀티모달 모델이에요. 핵심 아이디어는 Visual Instruction Tuning — 언어 모델의 지시 튜닝(instruction tuning) 방식을 이미지-언어 데이터로 확장한다는 거예요.

LLaVA의 등장 당시 큰 관심을 모았던 대목은, 13B 체크포인트 하나를 120만 개의 공개 데이터로, 단일 8-A100 노드에서 약 1일 안에 전체 훈련을 끝낼 수 있다는 점이었어요. 이 덕분에 최첨단 LMM(Large Multimodal Model) 연구 진입 장벽을 크게 낮췄죠.

핵심 구성

  • 비전 인코더(Vision encoder) — 이미지의 시각적 특징을 뽑아내요
  • 언어 모델(Language model) — 텍스트 생성과 추론을 담당해요
  • 멀티모달 프로젝터(Multimodal projector) — 비전 특징을 언어 모델의 임베딩 공간에 연결해요

데이터와 학습

초기 LLaVA는 GPT-4로 이미지-언어 지시 데이터를 합성해 활용했어요. "원본 텍스트를 그대로 복사"하는 게 아니라, 지시 튜닝 데이터로 이미지 이해 능력을 끌어올리는 방식을 제안했죠. 이후에는 CC3M 같은 공개 캡션 데이터 기반으로 더 강력한 버전들을 만들었어요.

더 알아보기