모델 (사전학습 백본별 사양)
모델 (사전학습 백본별 사양)
DINOv2는 여러 크기의 ViT 백본을 제공해요. 파라미터 수와 ImageNet k-NN·linear 성능을 비교하면 용도에 맞는 크기를 고를 수 있어요.
사전학습 백본 (distilled)
| 모델 | 파라미터 | registers | ImageNet k-NN | ImageNet linear |
|---|---|---|---|---|
| ViT-S/14 distilled | 21M | ❌ | 79.0% | 81.1% |
| ViT-S/14 distilled | 21M | ✅ | 79.1% | 80.9% |
| ViT-B/14 distilled | 86M | ❌ | 82.1% | 84.5% |
| ViT-B/14 distilled | 86M | ✅ | 82.0% | 84.6% |
| ViT-L/14 distilled | 300M | ❌ | 83.5% | 86.3% |
| ViT-L/14 distilled | 300M | ✅ | 83.8% | 86.7% |
| ViT-g/14 | 1,100M | ❌ | 83.5% | 86.5% |
| ViT-g/14 | 1,100M | ✅ | 83.7% | 87.1% |
registers열의 ✅는 "Vision Transformers Need Registers" 방식으로 registers를 추가한 버전이에요- 백본 외에도 이미지 분류·깊이 추정·의미론적 세그멘테이션용 linear/DPT 헤드도 제공돼요
- 파라미터 수는 ViT-S(21M), ViT-B(86M), ViT-L(300M), ViT-g(1,100M)로 커져요
확인할 점
체크포인트 파일은 vit_s/vit_b/vit_l/vit_g별 pretrain, _reg4(registers 4개 추가), linear head/DPT head 등으로 나뉘어 배포돼요. 가중치는 FAIR Noncommercial Research License 하에 공개돼요(특정 모델 제외).