데이터셋 다운로드 통계
데이터셋 다운로드 통계
데이터셋의 다운로드 수를 세는 건 간단한 작업이 아니에요. 하나의 데이터셋 저장소가 여러 서브셋과 스플릿(예: train/validation/test)의 여러 파일을 담을 수 있기 때문이에요.
출처: 문서
본문
데이터셋 다운로드가 어떻게 계산되나요?
한 사람의 다운로드를 여러 번 세는 것을 피하기 위해, 한 사용자(IP 주소 기준)가 주어진 저장소에서 5분 창 안에 다운로드한 모든 파일을 하나의 데이터셋 다운로드로 처리해요. 파일이 다운로드될 때(GET 또는 HEAD 요청) 우리 서버에서 자동으로 계산되며, 사용자 정보를 수집하거나 추가 호출이 필요 없어요.
2024년 9월 이전
Hub는 예전에 datasets 라이브러리로 불러올 수 있는 데이터셋에 대해서만 다운로드 통계를 제공했어요. 예전에는 파이썬에서 load_dataset가 호출될 때마다 카운트했는데, GitHub에서의 Hugging Face CI 도구는 제외했어요. 다운로드 수는 파일을 서빙할 때 서버 측에서 계산했어요. 즉:
- 데이터가 Hub 저장소에 직접 저장되어 있든, 외부 소스에서 데이터를 불러오는 스크립트가 있든 다운로드 수는 동일했어요.
- 사용자가
wget같은 도구나 Hub UI로 데이터를 수동 다운로드하면 그 다운로드는 카운트에 포함되지 않았어요.
데이터셋에 더 세분화된 다운로드 데이터가 필요하다면?
더 세분화된 데이터가 필요하다면, 예를 들어:
- 데이터 파일과 메타데이터를 구분하고 싶을 때,
- CI/CD 파이프라인의 다운로드를 제외하고 싶을 때,
- 사용자를 중복 제거(즉, 고유 다운로더 수를 세고 싶을 때) 할 때,
Publisher Analytics, 특히 granular logs 기능이 조직이 게시한 모든 모델과 데이터셋의 익명화된 요청 수준 접근 로그를 제공할 수 있어요.
이들은 원시 로그로 제공되며, 대부분 조직이 자신의 커스텀 규칙을 적용하려 하기 때문이에요.
더 알아보기 (Learn more)
- Publisher Analytics에서 요청 수준 접근 로그를 확인해 보세요.
- 모델 다운로드 통계 문서도 함께 참고하면 좋아요.