데이터셋 카드
데이터셋 카드 (Dataset Cards)
각 데이터셋은 저장소의 README.md 파일로 문서화될 수 있어요. 이 파일을 데이터셋 카드라고 하며, Hugging Face Hub가 그 내용을 데이터셋의 메인 페이지에 렌더링합니다. 데이터를 책임감 있게 사용하는 방법을 알려주기 위해 데이터셋 내 잠재적 편향에 대한 정보를 포함하는 것이 좋아요.
출처: 문서
본문
데이터셋 카드란 무엇인가요? (What are Dataset Cards?)
각 데이터셋은 저장소의 README.md 파일로 문서화될 수 있습니다. 이 파일을 데이터셋 카드라고 하며, Hugging Face Hub가 그 내용을 데이터셋의 메인 페이지에 렌더링해요. 데이터를 책임감 있게 사용하는 방법을 사용자에게 알려주기 위해, 데이터셋 내 잠재적 편향에 대한 정보를 포함하는 것이 좋습니다. 일반적으로 데이터셋 카드는 사용자가 데이터셋의 내용을 이해하고 데이터셋을 어떻게 사용해야 하는지에 대한 맥락을 줍니다.
카드에 데이터셋 메타데이터를 추가할 수도 있어요. 메타데이터는 라이선스, 언어, 크기 같은 데이터셋에 대한 중요한 정보를 설명합니다. 또한 사용자가 Hub에서 데이터셋을 발견하는 데 도움을 주는 태그와 데이터 파일 구성 옵션도 포함합니다. 태그는 README.md 파일 상단의 YAML 메타데이터 섹션에 정의됩니다.
데이터셋 카드 메타데이터 (Dataset card metadata)
데이터셋 저장소는 README.md를 데이터셋 카드로 렌더링합니다. Hub가 카드를 표시하는 방식을 제어하려면 README 파일에 YAML 섹션을 만들어 일부 메타데이터를 정의해야 합니다. 맨 위에 --- 세 개를 추가하고 관련 메타데이터를 모두 포함한 뒤, 아래 예시처럼 ---로 섹션을 닫으면 됩니다:
language:
- "List of ISO 639-1 code for your language"
- lang1
- lang2
pretty_name: "Pretty Name of the Dataset"
tags:
- tag1
- tag2
license: "any valid license identifier"
task_categories:
- task1
- task2
데이터셋 카드에 추가하는 메타데이터는 Hub에서 특정 상호작용을 가능하게 합니다. 예를 들어:
- 사용자가 https://huggingface.co/datasets에서 데이터셋을 필터링하고 발견할 수 있게 해줍니다.
- 이 표의 오른쪽 열에 나열된 키워드로 라이선스를 선택하면, 그 라이선스가 데이터셋 페이지에 표시됩니다.
Hub의 데이터셋 저장소에서 README.md 파일을 만들 때는 Metadata UI를 사용해 주요 메타데이터를 채웁니다.
메타데이터 필드를 보려면 상세한 Dataset Card 사양을 확인하세요.
데이터셋 카드 생성 가이드 (Dataset card creation guide)
데이터셋 카드 생성의 단계별 가이드는 Create a dataset card 가이드를 확인하세요.
ELI5 데이터셋 카드 같은 기존 데이터셋 카드를 읽어보는 것은 일반적인 관례에 익숙해지는 좋은 방법이에요.
논문 연결하기 (Linking a Paper)
데이터셋 카드가 페이퍼 페이지(HF 또는 Arxiv abstract/PDF) 링크를 포함한다면, Hub가 arXiv ID를 추출해 arxiv:<PAPER ID> 형식의 데이터셋 태그에 포함시킵니다. 태그를 클릭하면:
- 페이퍼 페이지를 방문할 수 있어요.
- 같은 논문을 인용하는 Hub의 다른 모델을 필터링할 수 있습니다.
페이퍼 페이지에 대해 더 알아보려면 여기를 읽어보세요.
데이터셋 모달리티 강제 설정 (Force set a dataset modality)
Hub는 데이터셋에 포함된 파일(오디오, 비디오, 지리공간 등)을 기반으로 데이터셋의 모달리티를 자동으로 감지해요. 특정 모달리티를 강제하고 싶다면 데이터셋 카드 메타데이터에 태그를 추가할 수 있습니다: 3d, audio, geospatial, image, tabular, text, timeseries, video.
예를 들어 모달리티를 audio로 강제하려면 데이터셋 카드 메타데이터에 다음을 추가하세요:
tags:
- audio
데이터셋에 라이브러리 연결 (Associate a library to the dataset)
데이터셋 페이지는 데이터셋을 네이티브로 로드할 수 있는 라이브러리와 도구를 자동으로 표시하지만, 다른 특정 라이브러리를 표시하고 싶다면 데이터셋 카드 메타데이터에 태그를 추가할 수 있어요. 지원 태그에는 argilla, dask, datasets, distilabel, fiftyone, harbor, mlcroissant, nemo-gym, openenv, pandas, verifiers, webdataset이 포함됩니다. 전체 목록은 지원 라이브러리 목록을 참고하거나, 새 라이브러리를 제안해 보세요.
예를 들어 argilla 라이브러리를 데이터셋 카드에 연결하려면 카드 메타데이터에 다음을 추가하세요:
tags:
- argilla
RL 환경 데이터셋 선언 (Declare an RL environment dataset)
RL 환경은 하나 이상의 환경 프레임워크가 소비할 수 있는 파일을 담은 일반적인 데이터셋 저장소입니다. rl-environment 태그를 추가하면 RL Environments 필터로 데이터셋을 발견할 수 있게 되고, 각 지원 프레임워크에 대한 태그도 추가할 수 있어요. 프레임워크 태그는 Use this dataset에 생성된 명령어도 추가합니다.
예를 들어 Harbor 작업 디렉터리를 담고 있고 Verifiers로도 로드할 수 있는 데이터셋은 다음 Dataset Card YAML을 사용합니다:
---
pretty_name: Terminal-Bench 2.0
tags:
- rl-environment
- harbor
- verifiers
---
지원되는 환경 프레임워크 태그는 다음과 같아요:
| 태그 | 프레임워크 |
|---|---|
harbor |
Harbor |
verifiers |
Verifiers |
openenv |
OpenEnv |
nemo-gym |
NeMo Gym |
이 태그들은 호환성을 설명하고 로드 명령어를 생성합니다. 새 저장소 유형을 만들거나 Hub가 환경을 실행하게 하지는 않아요.
더 알아보기 (Learn more)
README.md의 YAML 메타데이터(언어, 라이선스, 태그, task_categories 등)로 데이터셋 카드를 구성하면 Hub에서 데이터셋 발견·필터링이 가능해져요. 모달리티나 라이브러리는 태그로 강제할 수 있고, arXiv 논문 링크는 자동으로 arxiv:<ID> 태그가 됩니다. RL 환경 데이터셋은 rl-environment와 프레임워크 태그로 선언해요.