OpenAI CLIP (ViT 계열)
OpenAI CLIP (ViT 계열)
CLIP(Contrastive Language-Image Pretraining)은 OpenAI가 만든 이미지-텍스트 대조 학습 모델이에요. 이 카테고리는 공식 저장소의 clip 허브와 달리, OpenAI가 공식 배포한 ViT 계열 체크포인트(openai/clip-vit-*)와 Hugging Face transformers 지원에 초점을 맞춰요.
openai/clip-vit-large-patch14는 ViT-L/14를 이미지 인코더로 쓰고, 마스크드 셀프 어텐션 트랜스포머를 텍스트 인코더로 써요. 두 인코더는 (이미지, 텍스트) 쌍의 유사도를 최대화하도록 대조 손실로 훈련됐어요.
이 카테고리의 문서
- 모델: openai/clip-vit-large-patch14 모델 카드
- 기본 모델: openai/clip-vit-base-patch32
- transformers 사용법: CLIPModel·CLIPProcessor