CLIP (Contrastive Language-Image Pretraining)

CLIP (Contrastive Language-Image Pretraining)

CLIP은 OpenAI가 만든 대조 학습 기반 이미지-텍스트 멀티모달 모델이에요. 수많은 (이미지, 텍스트) 쌍으로 훈련해서, 이미지가 주어졌을 때 자연어로 "가장 관련 있는 텍스트 조각이 무엇인지" 예측하도록 만들었어요. 특정 작업을 직접 최적화하지 않고도, GPT-2·GPT-3 같은 모델의 제로샷 능력을 이미지 분류에 적용한 셈이죠.

ImageNet을 제로샷으로 분류했을 때, 원래 128만 개의 라벨 예시를 전혀 쓰지 않고도 기존 ResNet50의 성능에 맞춘다는 결과가 유명해요. 컴퓨터 비전에서 여러 주요 과제를 해결했다는 평가를 받았죠. 공식 코드는 MIT 라이선스로 공개돼 있어요.

이 카테고리의 문서

  • 개요: 대조 사전학습과 제로샷 분류
  • 사용법: 설치와 기본 추론 코드
  • 모델 버전: RN·ViT 계열 모델 목록

출처: https://github.com/openai/CLIP