LAVIS 설치와 추론
LAVIS 설치와 추론
LAVIS는 pip으로 설치하고, 마주한 이미지 파일을 모델에 넣어 추론 결과를 바로 받을 수 있어요. conda 환경을 쓰면 의존성 관리가 수월해요.
설치는 conda 환경을 만들어 진행하는 걸 권장해요. PyTorch 설치가 선행돼야 해요.
conda create -n lavis python=3.8
conda activate lavis
pip install salesforce-lavis
추론 예시를 볼게요. 로컬 이미지를 로드해서 BLIP 기반 캡셔닝 모델로 설명을 생성하는 흐름이에요.
import torch
from PIL import Image
from lavis.models import load_model_and_preprocess
device = torch.device("cuda" if torch.cuda.is_available() else "cpu")
raw_image = Image.open("docs/_static/merlion.png").convert("RGB")
model, vis_processors, _ = load_model_and_preprocess(
name="blip_caption", model_type="base_coco", is_eval=True, device=device
)
image = vis_processors["eval"](raw_image).unsqueeze(0).to(device)
caption = model.generate({"image": image})
load_model_and_preprocess에 모델 이름과 타입을 넘기면, 모델과 전처리 파이프라인이 함께 준비돼요. vis_processors["eval"]로 이미지를 전처리하고, model.generate()로 캡션을 생성하는 구조예요. name="blip_caption", model_type="base_coco" 같은 조합이 LAVIS의 모델 zoo를 구성하는 방식이에요.
GPU가 있다면 device = torch.device("cuda" ...)로 가속할 수 있어요. 이렇게 사전 학습된 모델 하나로 자기 데이터에서 곧바로 최신 멀티모달 추론을 해볼 수 있는 게 LAVIS의 장점이에요.