openai/clip-vit-base-patch32
openai/clip-vit-base-patch32
openai/clip-vit-base-patch32는 OpenAI CLIP 가족에서 가볍고 널리 쓰이는 기본 체크포인트예요. ViT-B/32 아키텍처(패치 32x32)를 이미지 인코더로 쓰고, 마스크드 셀프 어텐션 트랜스포머를 텍스트 인코더로 써요.
특징
- ViT-B/32: 이미지 패치 크기 32x32의 베이스 크기 비전 트랜스포머
- large 모델보다 가볍고 속도가 빨라, 임베딩 파이프라인·제로샷 분류 실험에 자주 쓰여요.
- CLIP 대조 손실로 (이미지, 텍스트) 쌍을 정렬해요.
transformers로 사용하기
from transformers import CLIPModel, CLIPProcessor
model = CLIPModel.from_pretrained("openai/clip-vit-base-patch32")
processor = CLIPProcessor.from_pretrained("openai/clip-vit-base-patch32")
두 클래스(CLIPModel, CLIPProcessor)는 두 체크포인트에서 공통으로 쓰여요. 텍스트·이미지 입력을 processor로 전처리하고, model(**inputs)로 logits_per_image, logits_per_text, text_embeds, image_embeds를 얻어요.
언제 쓰면 좋을까요
이미지-텍스트 임베딩을 가볍게 뽑아 검색·제로샷 태스크로 확장하거나, large 모델과 성능을 비교하고 싶을 때 좋아요.