LAVIS 개요

LAVIS 개요

LAVIS는 '이미지와 비디오, 그리고 텍스트를 함께 다루는 모델을 쉽게 쓰고 만들게' 하려는 라이브러리예요. 리트리벌, 캡셔닝, VQA 같은 태스크를 통일된 인터페이스로 접근할 수 있게 해 줘요.

출처: salesforce/LAVIS

LAVIS는 언어와 비전 지능 연구·응용을 위한 파이썬 딥러닝 라이브러리예요. 엔지니어와 연구자에게 특정 다중 모달 시나리오를 위한 모델을 빠르게 개발하고, 표준·커스텀 데이터셋에서 벤치마킹할 수 있는 '원스톱 솔루션'을 제공하는 게 목표예요.

핵심 특징을 정리하면 이래요.

  • 통합·모듈형 인터페이스 — 10개 이상의 태스크(리트리벌, 캡셔닝, visual question answering, 멀티모달 분류 등)와 20개 이상의 데이터셋(COCO, Flickr, Nocaps 등)을 하나로 접근
  • 쉬운 아웃오브박스 추론·특징 추출 — 사전 학습된 모델로 자기 데이터에 최신 멀티모달 이해·생성 능력 활용
  • 재현 가능한 모델 zoo·학습 레시피 — 최신 모델을 기존·새 태스크에 재현·확장
  • 데이터셋 zoo·자동 다운로드 도구 — 언어-비전 데이터셋 준비의 번거로움 해소

지원하는 사전 학습 모델로는 ALBEF, BLIP, ALPRO, CLIP 등이 대표적이에요. 특히 BLIP-2는 이미지 이해를 위해 사전 학습된 비전 모델과 대규모 언어 모델(LLM)을 연결하는 효율적인 파이토닝 전략을 제시한 모델로, zero-shot 캡셔닝에서 강한 성능을 보여줬어요.

더 알아보기