사용법 (설치와 추론)
사용법 (설치와 추론)
CLIP은 파이썬 패키지로 설치해서 바로 쓸 수 있어요. PyTorch 1.7.1 이상과 torchvision이 필요해요.
설치
CUDA GPU가 있는 환경이라면 다음처럼 설치해요.
$ conda install --yes -c pytorch pytorch=1.7.1 torchvision cudatoolkit=11.0
$ pip install ftfy regex tqdm
$ pip install git+https://github.com/openai/CLIP.git
cudatoolkit=11.0은 자신의 CUDA 버전에 맞게 바꾸고, GPU가 없다면 cpuonly를 쓰면 돼요.
기본 추론
import torch
import clip
from PIL import Image
device = "cuda" if torch.cuda.is_available() else "cpu"
model, preprocess = clip.load("ViT-B/32", device=device)
image = preprocess(Image.open("CLIP.png")).unsqueeze(0).to(device)
text = clip.tokenize(["a diagram", "a dog", "a cat"]).to(device)
with torch.no_grad():
image_features = model.encode_image(image)
text_features = model.encode_text(text)
logits_per_image, logits_per_text = model(image, text)
probs = logits_per_image.softmax(dim=-1).cpu().numpy()
print("Label probs:", probs) # prints: [[0.9927937 0.00421068 0.00299572]]
clip.load("ViT-B/32", device=device)는 모델과 함께 필요한 TorchVision transform을 함께 돌려줘요.