LLaVA (Large Language and Vision Assistant)
LLaVA (Large Language and Vision Assistant)
LLaVA는 이미지와 언어를 함께 이해하는 비전-언어 멀티모달 모델이에요. "Visual Instruction Tuning"이라는 방식으로 이미지 지시 데이터로 파인튜닝해, GPT-4V급 이미지 이해·추론 능력을 목표로 해요. 그림을 보고 질문에 답하고, 이미지에 대한 설명을 자연스럽게 생성하는 식이죠.
LLaVA는 NeurIPS 2023 Oral로 채택된 "Visual Instruction Tuning" 논문(arXiv:2304.08485)에서 시작했어요. 초기에는 GPT-4로 생성한 지시 데이터를 활용해 이미지-언어 모델을 튜닝하는 방법을 제시했고, 이후 LLaVA-1.5, LLaVA-NeXT 같은 후속 버전으로 계속 발전했어요. 공식 코드는 Apache 2.0 라이선스로 공개돼 있어요.
이 카테고리의 문서
- 개요: Visual Instruction Tuning과 LLaVA의 등장 배경
- 모델 계열: LLaVA-1.5·LLaVA-NeXT 제품군
- 사용법: transformers로 로드·추론