개요 (쌍별 시그모이드 손실)
개요 (쌍별 시그모이드 손실)
SigLIP(Sigmoid Loss for Language-Image Pre-training)은 CLIP과 매우 유사한 구조의 이미지-텍스트 모델이에요. 이미지와 텍스트를 각각 별개의 인코더로 처리해 두 모달리티의 표현을 만들어요.
CLIP과의 차이 — 훈련 손실
핵심 차이는 훈련 손실이에요.
- CLIP — 배치 안의 모든 이미지-텍스트 쌍 유사도를 전역으로 봐야 하는 대조 손실
- SigLIP — 각 이미지-텍스트 쌍에 대해 쌍별 시그모이드 손실(pairwise sigmoid loss) 사용
쌍별 시그모이드 손실은 배치 안의 모든 쌍별 유사도에 대한 전역 뷰가 필요 없어요. 그래서 더 큰 배치 크기로 효율적으로 스케일링할 수 있고, 반대로 작은 배치 크기에서도 더 나은 성능을 낼 수 있어요. 이 점이 SigLIP이 주목받는 이유예요.
원본 체크포인트
원본 SigLIP 체크포인트들은 Hugging Face의 SigLIP 컬렉션에 모여 있어요. 대표적으로 google/siglip-base-patch16-224가 널리 쓰여요.