개요 (자기지도 사전학습)

개요 (자기지도 사전학습)

DINOv2는 "감독 없이 견고한 시각 특징을 학습한다"는 목표로 만들어진 메타 AI 리서치(FAIR)의 모델이에요. 1억 4,200만 장의 이미지를 라벨·주석 없이 사전학습했어요.

핵심 아이디어

  • 모델들이 선형 계층 같은 단순한 분류기와 바로 결합 가능한 고성능 시각 특징을 생산하도록 학습
  • 파인튜닝 없이도 여러 도메인에서 견고하게 잘 동작
  • 분류, 검출, 세그멘테이션, 깊이 추정과 같은 작업에 공용 백본으로 활용

관련 연구

  • DINOv2: Learning Robust Visual Features without Supervision (arXiv:2304.07193) — 핵심 사전학습 방법
  • Vision Transformers Need Registers (arXiv:2309.16588) — ViT에 registers를 추가한 개선(성능·아티팩트 개선)
  • 최신 후속으로 DINOv3 작업도 진행 중이에요

활용

단순히 백본만으로도 강력해요. 여기에 붙이는 헤드가 아주 단순하다 보니, 연구·산업 모두에서 특징 추출기(feature extractor)로 널리 쓰여요.

더 알아보기