개요 (이미지·비디오 세그멘테이션)

개요 (이미지·비디오 세그멘테이션)

SAM 2는 Meta AI(BasicAI Research, FAIR)가 발표한 SAM(Segment Anything Model)의 후속작이에요. 논문 제목은 "SAM 2: Segment Anything in Images and Videos" (arXiv:2408.00714)이고, Apache 2.0 라이선스로 공개됐어요.

핵심 아이디어

  • 한 모델이 이미지와 비디오 양쪽에서 동작해요.
  • 이미지에선 클릭·박스 같은 프롬프트로 특정 객체를 분할해요.
  • 비디오에선 객체를 프롬프트로 지정하면 프레임을 따라 추적(tracking)하며 분할 마스크를 유지해요.
  • 아키텍처는 Hiera 비전 트랜스포머가 핵심 백본이에요.

SA-V (데이터셋)

  • 비디오 세그멘테이션을 위해 SA-V 데이터셋을 공개했어요.
  • 대규모 비디오 객체 분할 데이터로, 프롬프트 기반 비디오 어노테이션을 지원해요.

의의

SAM 1이 '이미지 세그멘테이션의 기초 모델'이라면, SAM 2는 그것을 시간 축(비디오)으로 확장해 실시간 객체 추적·분할을 가능하게 만든 모델이에요.

더 알아보기