개요 (대조 사전학습과 제로샷)
개요 (대조 사전학습과 제로샷)
CLIP(Contrastive Language-Image Pre-Training)은 이미지와 텍스트를 함께 묶어 학습하는 대조 학습 모델이에요. 다양한 (이미지, 텍스트) 쌍으로 훈련해서, 주어진 이미지에 가장 관련 높은 텍스트 조각("캡션"이나 "클래스 이름")을 자연어로 예측하게 만들었죠.
핵심 아이디어
훈련 시 이미지 인코더와 텍스트 인코더가 대조 손실(contrastive loss) 로 이미지-텍스트 쌍의 유사도를 최대화하도록 학습해요. 그 결과 한쪽만 주어져도 다른 쪽의 특징을 잘 매핑하게 돼요.
제로샷 분류
- ImageNet을 제로샷으로 분류할 때, 기존 1.28M 라벨 예시를 전혀 사용하지 않고 ResNet50 성능에 맞춤
- 즉 분류 계층 없이도, "이 이미지는 무슨 클래스인가"를 자연어 프롬프트로 물어서 답을 얻음
- 30개가 넘는 다양한 벤치마크(OCR, 텍스처 인식, 세분화 분류 등)에서 평가됨
한계
CLIP은 세분화된 분류(fine-grained classification)나 객체 카운팅 같은 작업에서는 어려움을 겪어요. 또 훈련 데이터가 인터넷 크롤링 기반이라 지역·성별 편향이 있을 수 있어서, 공정성에 대한 검토가 필요해요.