사용법 (설치와 추론)

사용법 (설치와 추론)

CLIP은 파이썬 패키지로 설치해서 바로 쓸 수 있어요. PyTorch 1.7.1 이상과 torchvision이 필요해요.

설치

CUDA GPU가 있는 환경이라면 다음처럼 설치해요.

$ conda install --yes -c pytorch pytorch=1.7.1 torchvision cudatoolkit=11.0
$ pip install ftfy regex tqdm
$ pip install git+https://github.com/openai/CLIP.git

cudatoolkit=11.0은 자신의 CUDA 버전에 맞게 바꾸고, GPU가 없다면 cpuonly를 쓰면 돼요.

기본 추론

import torch
import clip
from PIL import Image

device = "cuda" if torch.cuda.is_available() else "cpu"
model, preprocess = clip.load("ViT-B/32", device=device)

image = preprocess(Image.open("CLIP.png")).unsqueeze(0).to(device)
text = clip.tokenize(["a diagram", "a dog", "a cat"]).to(device)

with torch.no_grad():
    image_features = model.encode_image(image)
    text_features = model.encode_text(text)

    logits_per_image, logits_per_text = model(image, text)
    probs = logits_per_image.softmax(dim=-1).cpu().numpy()

print("Label probs:", probs)  # prints: [[0.9927937  0.00421068 0.00299572]]

clip.load("ViT-B/32", device=device)는 모델과 함께 필요한 TorchVision transform을 함께 돌려줘요.

더 알아보기