발표 (SA-V 데이터셋과 비디오 확장)

발표 (SA-V 데이터셋과 비디오 확장)

Meta AI는 SAM 2 공개 당시 블로그에서 한 모델로 이미지와 비디오를 모두 처리하는 비전을 설명했어요. 핵심은 사전훈련된 이미지 모델을 비디오로 확장하는 방식과, 그걸 뒷받침하는 대규모 비디오 데이터셋 SA-V예요.

블로그의 핵심 메시지

  • 프롬프트 기반: 이미지나 비디오의 특정 객체를 클릭하거나 박스로 지정하면 그 객체를 분할해요.
  • 비디오 추적: 한 프레임에서 지정한 객체를 이후 프레임에서도 계속 따라가며 마스크를 유지해요.
  • 실시간 응답: 대화형으로 객체를 선택·추적할 수 있도록 반응 속도를 중시했어요.

SA-V 데이터셋

  • 비디오 객체 분할을 위한 대규모 주석 데이터셋이에요.
  • 연구·개발 목적으로 공개돼, 비디오 세그멘테이션 연구의 공통 벤치마크로 쓰여요.

활용

콘텐츠 편집(객체 잘라내기), 비디오 분석, 자율주행·로봇 비전 등 다양한 비디오 이해 작업에 적용할 수 있어요.

더 알아보기