모델 버전 (RN·ViT 계열)
모델 버전 (RN·ViT 계열)
CLIP의 기본 모델은 이미지 인코더로 ResNet50을 개조한 버전을, 텍스트 인코더로 마스크드 셀프어텐션 Transformer를 써요. 이미지 인코더를 Vision Transformer(ViT)로 바꾼 변형도 함께 공개됐어요.
공개된 모델 버전 (출시 순서)
- RN50, ViT-B/32 — 최초 공개 (Vision Transformer 계열인 ViT-B/32 + ResNet 계열 RN50)
- RN101, RN50x4 — 후속 배포. RN50x4는 EfficientNet 스케일링 규칙에 따라 RN50을 4배 확장한 모델이에요
- RN50x16, ViT-B/16 — 2021년 7월 공개
- RN50x64, ViT-L/14 — 2022년 1월 공개
- ViT-L/14@336px — 2022년 4월 공개 (336px 해상도)
모델 이름 훑어보기
RN50,RN101— ResNet 계열 이미지 인코더RN50x4,RN50x16,RN50x64— RN50을 EfficientNet 규칙으로 스케일링한 버전ViT-B/32,ViT-B/16,ViT-L/14— Vision Transformer 백본, 패치 크기 표기ViT-L/14@336px— ViT-L/14를 336px 입력으로 재학습
clip.available_models()로 현재 사용 가능한 CLIP 모델 이름 목록을 확인할 수 있어요.