허브의 데이터셋
허브의 데이터셋
Hugging Face Hub의 데이터셋 섹션은 다양한 도메인·작업의 데이터 모음을 호스팅해요. 이 문서는 Hub에서 데이터셋과 상호작용하는 방법(업로드, 탐색, 프로젝트에서 사용)을 안내해요. 참고로 이 페이지는 Hub의 데이터셋 기능에 초점을 맞추고, 🤗 datasets 파이썬 패키지의 상세한 사용법은 별도 Datasets 문서에서 다뤄요.
데이터셋 개요와 카드
각 데이터셋에는 데이터셋 카드가 붙어, 데이터의 구성·특성·평가, 사용 시 주의사항을 알려줘요. 브라우저에서 바로 데이터를 살펴볼 수 있는 데이터셋 뷰어와 데이터 스튜디오도 지원돼요.
게이티드 데이터셋
모델과 마찬가지로 데이터셋도 **게이티드(gated)**로 만들 수 있어요. 라이선스·프라이버시 이슈 때문에 특정 사용자만 접근하게 하고 싶을 때 사용자가 액세스 요청을 보내고 승인을 받게 해요. 프라이빗 데이터셋도 만들 수 있어요.
업로드·다운로드
데이터셋을 업로드하는 방법은 여러 가지예요. datasets 라이브러리의 push_to_hub(), git, 또는 웹 UI로 파일을 올릴 수 있어요. 다운로드는 datasets의 load_dataset() 또는 huggingface_hub의 snapshot_download()가 담당해요.
from datasets import load_dataset
dataset = load_dataset("squad", split="train")
데이터 파일 구성
데이터셋 저장소는 데이터 파일을 담는 구조예요. 하나의 데이터셋이 여러 구성(configuration)을 가질 수 있어서, 언어별·버전별 데이터를 한 저장소에 정리해 둘 수도 있어요. 데이터 파일 구성 방식은 별도 문서에서 자세히 설명해요.
라이브러리와 스트리밍
datasets, transformers 등의 라이브러리가 Hub 데이터셋과 통합되어 있어요. 스트리밍 모드를 쓰면 전체를 다운로드하지 않고도 큰 데이터셋을 조각으로 읽어 메모리를 절약할 수 있어요.
더 알아보기
- 허브 시작하기: Hub Overview
- 데이터셋 라이브러리: datasets
- 데이터 파일 구성: Data files configuration