모델 (사전학습 백본별 사양)

모델 (사전학습 백본별 사양)

DINOv2는 여러 크기의 ViT 백본을 제공해요. 파라미터 수와 ImageNet k-NN·linear 성능을 비교하면 용도에 맞는 크기를 고를 수 있어요.

사전학습 백본 (distilled)

모델 파라미터 registers ImageNet k-NN ImageNet linear
ViT-S/14 distilled 21M 79.0% 81.1%
ViT-S/14 distilled 21M 79.1% 80.9%
ViT-B/14 distilled 86M 82.1% 84.5%
ViT-B/14 distilled 86M 82.0% 84.6%
ViT-L/14 distilled 300M 83.5% 86.3%
ViT-L/14 distilled 300M 83.8% 86.7%
ViT-g/14 1,100M 83.5% 86.5%
ViT-g/14 1,100M 83.7% 87.1%
  • registers 열의 ✅는 "Vision Transformers Need Registers" 방식으로 registers를 추가한 버전이에요
  • 백본 외에도 이미지 분류·깊이 추정·의미론적 세그멘테이션용 linear/DPT 헤드도 제공돼요
  • 파라미터 수는 ViT-S(21M), ViT-B(86M), ViT-L(300M), ViT-g(1,100M)로 커져요

확인할 점

체크포인트 파일은 vit_s/vit_b/vit_l/vit_g별 pretrain, _reg4(registers 4개 추가), linear head/DPT head 등으로 나뉘어 배포돼요. 가중치는 FAIR Noncommercial Research License 하에 공개돼요(특정 모델 제외).

더 알아보기