데이터셋 업로드하기
데이터셋 업로드하기 (Uploading datasets)
Hub는 커뮤니티 큐레이션 및 연구 데이터셋의 방대한 컬렉션을 보유하고 있어요. 데이터셋을 Hub에 공유해 ML 커뮤니티의 성장과 모두의 발전을 돕는 것을 권장합니다. 모든 기여를 환영하며, 데이터셋 추가는 드래그 앤 드롭만 하면 됩니다!
출처: 문서
본문
Hub는 커뮤니티에서 큐레이션하고 연구에서 만든 데이터셋의 방대한 컬렉션을 보유하고 있습니다. 데이터셋을 Hub에 공유해 ML 커뮤니티의 성장과 모두의 발전을 가속화하는 것을 권장합니다. 모든 기여를 환영하며, 데이터셋 추가는 드래그 앤 드롭만 하면 됩니다!
아직 계정이 없다면 Hugging Face Hub 계정 만들기부터 시작하세요.
Hub UI로 업로드 (Upload using the Hub UI)
Hub의 웹 기반 인터페이스는 개발 경험이 없는 사용자도 데이터셋을 업로드할 수 있게 해줍니다.
저장소 만들기 (Create a repository)
저장소는 리비전 기록을 포함해 모든 데이터셋 파일을 호스팅하므로, 데이터셋의 여러 버전을 저장할 수 있습니다.
- 프로필을 클릭하고 New Dataset을 선택해 새 데이터셋 저장소를 만듭니다.
- 데이터셋 이름을 고르고 공개 또는 비공개 데이터셋인지 선택합니다. 공개 데이터셋은 누구에게나 보이고, 비공개 데이터셋은 나 또는 조직 멤버만 볼 수 있어요.
데이터셋 업로드 (Upload dataset)
- 저장소를 만들었다면 Files and versions 탭으로 이동해 파일을 추가합니다. Add file을 선택해 데이터셋 파일을 업로드하세요.
.csv,.mp3,.jpg같은 많은 텍스트·오디오·이미지 및 기타 데이터 확장자를 지원합니다(전체 파일 형식 목록 참고). - 데이터셋 파일을 드래그 앤 드롭합니다.
- 데이터셋 파일을 업로드하면 데이터셋 저장소에 저장됩니다.
데이터셋 카드 만들기 (Create a Dataset card)
Dataset 카드를 추가하면 사용자가 내 데이터셋을 찾고 책임감 있게 사용하는 방법을 이해하는 데 매우 유용합니다.
-
Create Dataset Card를 클릭해 Dataset card를 만듭니다. 이 버튼은 저장소에
README.md파일을 생성해요. -
상단에 라이선스, 언어, task categories 같은 여러 필드가 있는 Metadata UI가 보일 거예요. 이것들은 (해당될 때) 사용자가 Hub에서 내 데이터셋을 발견하는 데 가장 중요한 태그입니다. 필드에 옵션을 선택하면 자동으로 데이터셋 카드 상단에 추가됩니다.
옵션인
annotations_creators같은 허용 태그 전체를 가진 Dataset Card 사양도 확인해 내 데이터셋에 유용한 태그를 고를 수 있어요. -
Dataset Card에 데이터셋 문서를 작성해 커뮤니티에 데이터셋을 소개하고 사용자가 안에 무엇이 있는지 이해하도록 돕습니다: 사용 사례와 한계는 무엇인지, 데이터가 어디서 왔는지, 중요한 윤리적 고려 사항은 무엇인지, 그 밖의 관련 세부 정보 등.
에디터 상단의 Import dataset card template 링크를 클릭해 데이터셋 카드 템플릿을 자동으로 만들 수 있어요. 좋은 Dataset card가 어떤 모습인지에 대한 상세한 예시는 CNN DailyMail Dataset card를 확인하세요.
huggingface_hub 클라이언트 라이브러리 사용 (Using the huggingface_hub client library)
huggingface_hub 라이브러리의 풍부한 기능은 저장소 생성과 Hub에 데이터셋 업로드를 포함해 저장소를 관리할 수 있게 해줍니다. 더 알아보려면 클라이언트 라이브러리 문서를 방문하세요.
다른 라이브러리 사용 (Using other libraries)
🤗 Datasets, Pandas, Polars, Dask, DuckDB, Daft 같은 일부 라이브러리는 Hub에 파일을 업로드할 수 있어요. 자세한 정보는 Datasets Hub가 지원하는 라이브러리 목록을 참고하세요.
Git 사용 (Using Git)
데이터셋 저장소는 Git 저장소이므로 Git을 사용해 데이터 파일을 Hub에 푸시할 수 있습니다. Getting Started with Repositories 가이드를 따라 git CLI로 데이터셋을 커밋하고 푸시하는 방법을 배워보세요.
데이터셋 인제스트 (Ingest datasets)
데이터베이스, 클라우드 스토리지 또는 API 뒤에 데이터가 있다면, 즉시 사용 가능한 데이터셋으로 Hugging Face에 인제스트할 수 있어요.
자세한 정보는 데이터셋 인제스트 문서에서 확인하세요.
파일 형식 (File formats)
Hub는 여러 파일 형식을 네이티브로 지원합니다:
- Parquet (.parquet)
- CSV (.csv, .tsv)
- JSON Lines, JSON (.jsonl, .json)
- Arrow streaming 및 IPC 형식 (.arrow)
- 텍스트 (.txt)
- 이미지 (.png, .jpg 등)
- 오디오 (.wav, .mp3 등)
- 비디오 (.mp4, .mov, .avi 등)
- PDF (.pdf)
- WebDataset (.tar)
- Lance (.lance)
ZIP (.zip), GZIP (.gz), ZSTD (.zst), BZ2 (.bz2), LZ4 (.lz4), LZMA (.xz)로 압축된 파일도 지원합니다.
이미지와 오디오 파일은 추가 메타데이터 파일도 가질 수 있어요. 이미지·오디오 데이터셋의 Data files Configuration와 CSV·TSV·이미지용 예시 데이터셋 모음을 참고하세요.
Hub의 모든 기능을 활용하려면 파일을 이러한 형식으로 변환하는 것이 좋습니다. 다른 형식과 구조는 Hub가 인식하지 못할 수 있어요.
어떤 파일 형식을 사용해야 하나요? (Which file format should I use?)
대부분의 데이터셋 유형에는 Parquet이 권장됩니다. 효율적인 압축, 풍부한 타이핑, 그리고 다양한 도구가 최적화된 읽기·배치 작업을 지원하기 때문이에요. 또는 테이블 데이터에는 CSV나 JSON Lines/JSON을 사용할 수 있습니다(중첩 데이터에는 JSON Lines 선호). Parquet보다 파싱하기 쉽지만, 몇 GB 이상의 데이터에는 이 형식들이 권장되지 않아요. 이미지·오디오 데이터셋의 경우 대부분의 사용 사례에서 개별 파일에 쉽게 접근할 수 있으므로 원시 파일을 업로드하는 것이 가장 실용적이에요. 대규모 이미지·오디오 데이터셋 스트리밍에는 원시 파일 대신 WebDataset이 개별 파일 접근 오버헤드를 피하므로 선호됩니다. 다만 분석, 데이터 필터링, 메타데이터 파싱 같은 더 일반적인 사용 사례에서는 대규모 이미지·오디오 데이터셋에도 Parquet이 권장 옵션입니다.
Data Studio
Data Studio는 다운로드하기 전에 데이터가 실제로 어떻게 생겼는지 아는 데 유용합니다. 모든 공개 데이터셋에 기본적으로 활성화되어 있어요. PRO 사용자 또는 Team·Enterprise 조직이 소유한 비공개 데이터셋에서도 사용할 수 있습니다.
데이터셋을 업로드한 뒤 Dataset Viewer가 내 데이터를 올바르게 표시하는지 확인하거나, Dataset Viewer 구성을 참고하세요.
대규모 데이터셋 (Large scale datasets)
Hugging Face Hub는 대규모 데이터셋을 지원하며, 보통 Parquet(예: 🤗 Datasets의 push_to_hub() 사용) 또는 WebDataset 형식으로 업로드합니다.
huggingface_hub 라이브러리로 대규모 데이터셋을 고속으로 업로드할 수 있어요.
폴더를 청크로 업로드하는 방법, 대용량 업로드 팁과 요령, 저장소 저장 한도와 권장 사항을 참고하세요.
더 알아보기 (Learn more)
Hub UI에서 New Dataset으로 저장소를 만들고, Files and versions 탭에서 파일을 드래그 앤 드롭해 업로드한 뒤 Dataset Card를 작성해 데이터셋을 공유할 수 있어요. huggingface_hub, PyTorch·Polars·DuckDB 같은 라이브러리, 또는 git을 사용할 수도 있습니다. Parquet을 권장하며, 대규모 데이터셋은 Parquet/WebDataset 형식과 push_to_hub()를 이용하세요.