openai/clip-vit-base-patch32

openai/clip-vit-base-patch32

openai/clip-vit-base-patch32는 OpenAI CLIP 가족에서 가볍고 널리 쓰이는 기본 체크포인트예요. ViT-B/32 아키텍처(패치 32x32)를 이미지 인코더로 쓰고, 마스크드 셀프 어텐션 트랜스포머를 텍스트 인코더로 써요.

특징

  • ViT-B/32: 이미지 패치 크기 32x32의 베이스 크기 비전 트랜스포머
  • large 모델보다 가볍고 속도가 빨라, 임베딩 파이프라인·제로샷 분류 실험에 자주 쓰여요.
  • CLIP 대조 손실로 (이미지, 텍스트) 쌍을 정렬해요.

transformers로 사용하기

from transformers import CLIPModel, CLIPProcessor

model = CLIPModel.from_pretrained("openai/clip-vit-base-patch32")
processor = CLIPProcessor.from_pretrained("openai/clip-vit-base-patch32")

두 클래스(CLIPModel, CLIPProcessor)는 두 체크포인트에서 공통으로 쓰여요. 텍스트·이미지 입력을 processor로 전처리하고, model(**inputs)logits_per_image, logits_per_text, text_embeds, image_embeds를 얻어요.

언제 쓰면 좋을까요

이미지-텍스트 임베딩을 가볍게 뽑아 검색·제로샷 태스크로 확장하거나, large 모델과 성능을 비교하고 싶을 때 좋아요.

더 알아보기