모델 계열 (LLaVA-1.5·LLaVA-NeXT)

모델 계열 (LLaVA-1.5·LLaVA-NeXT)

LLaVA는 시간이 지나면서 여러 버전으로 발전했어요. 초기 LLaVA에 이어 LLaVA-1.5, 그리고 더 강력한 백본을 쓴 LLaVA-NeXT 계열이 나왔어요.

LLaVA(초기)와 LLaVA-1.5

  • LLaVA — GPT-4로 만든 지시 데이터로 이미지-언어 모델 튜닝 (NeurIPS 2023 Oral)
  • LLaVA-1.5 — 공개 데이터 중심으로 파이프라인을 다시 설계한 개선 버전. CLIP 비전 인코더와 Vicuna 기반 언어 모델을 조합해 강력한 성능을 냈어요.

LLaVA-NeXT (2024)

LLaVA-NeXT는 더 큰 언어 모델을 백본으로 탑재한 후속 계열이에요.

  • 2024/05/10 Stronger 모델 공개 — **Llama-3 (8B)**와 Qwen-1.5 (72B/110B) 기반
  • 더 큰 LLM을 비전 인코더와 결합해 추론·이미지 이해 능력 강화
  • 모델에 따라 72B·110B급 거대 모델까지 지원

공개 체크포인트

Hugging Face의 llava-hf 컬렉션에서 transformers 호환 체크포인트를 받을 수 있어요. 대표적으로 llava-hf/llava-1.5-7b-hf가 널리 쓰여요.

더 알아보기