SigLIP (Sigmoid Loss for Language-Image Pre-training)
SigLIP (Sigmoid Loss for Language-Image Pre-training)
SigLIP은 CLIP과 비슷한 이미지-텍스트 멀티모달 모델이에요. 이미지 인코더와 텍스트 인코더를 분리해 각각의 표현을 생성하는 구조인데, 훈련 손실에서 CLIP과 차이가 나요.
CLIP은 배치 안의 모든 이미지-텍스트 쌍 유사도를 전역적으로 봐야 하는 반면, SigLIP은 이미지-텍스트 쌍에 대해 쌍별(pairwise) 시그모이드 손실을 사용해요. 덕분에 더 큰 배치 크기로 효율적으로 스케일링할 수 있고, 작은 배치 크기에서도 더 나은 성능을 낼 수 있어요. 원본 체크포인트들은 Hugging Face SigLIP 컬렉션에서 받을 수 있어요.
이 카테고리의 문서
- 개요: 쌍별 시그모이드 손실과 특징
- 사용법: 제로샷 이미지 분류 추론
- 양자화: int4로 메모리 절감
출처: https://huggingface.co/docs/transformers/en/model_doc/siglip