데이터셋(Datasets)
데이터셋(Datasets)
Hub의 데이터셋 기능과 지원 라이브러리에서 데이터셋을 쓰는 방법을 다루는 문서예요. Hub는 8천 개 이상의 언어, NLP·컴퓨터 비전·오디오 등 광범위한 태스크에 쓸 수 있는 수십만 개의 공개 데이터셋을 호스팅해요. 🤗 datasets Python 패키지에 대한 자세한 내용은 🤗 Datasets 문서를 참고해요.
출처: 공식문서
본문
데이터셋 문서에서 다루는 항목:
- Datasets Overview — 데이터셋 허브의 전반적인 개념
- Dataset Cards — 데이터셋을 설명하는 문서, 브라우저에서 바로 데이터 탐색
- Gated Datasets — 라이선스·프라이버시 때문에 접근을 제한한 데이터셋
- Uploading Datasets — 데이터셋 업로드 방법
- Downloading Datasets — 데이터셋 다운로드 방법
- Libraries — Hub를 지원하는 데이터셋 라이브러리
- Dataset Viewer — 브라우저에서 데이터셋을 미리 보는 뷰어
- Agent Traces — 에이전트 추적 데이터
- Data files Configuration — 데이터 파일 구성
많은 데이터셋이 공개지만, **조직(organizations)**과 개인은 라이선스나 프라이버시 문제를 지키기 위해 비공개 데이터셋을 만들 수도 있어요. 🤗 datasets 라이브러리로 한 줄 코드만으로 데이터셋에 접근할 수 있고, 컴퓨터에 안 들어갈 만큼 커도 **스트리밍(streaming)**으로 효율적으로 데이터를 읽을 수 있어요.
더 알아보기
- 데이터셋 카드 작성법은 Dataset Cards 문서에서
- 🤗 datasets 패키지는 Datasets documentation에서