퀵스타트(Quickstart)
퀵스타트(Quickstart)
Datasets를 처음 쓴다면, 데이터셋을 불러와 탐색하고 간단히 가공하는 기본 흐름을 익히면 좋아요. load_dataset()으로 불러오고, 분할·구성(설정)을 확인하고, 필요하면 필터나 변환을 적용해요. 이 퀵스타트는 load_dataset()의 기본 쓰임새를 중심으로 안내해요.
데이터셋 로드
load_dataset()에 Hub 데이터셋 id를 넘기면 됩니다. 분할을 지정하면 Dataset, 지정하지 않으면 DatasetDict가 돌아와요.
from datasets import load_dataset
# 특정 분할만
dataset = load_dataset("cornell-movie-review-data/rotten_tomatoes", split="train")
# 전체 분할
ddict = load_dataset("cornell-movie-review-data/rotten_tomatoes")
탐색
로드한 Dataset은 pandas처럼 취급할 수 있어요. 컬럼명·행 수는 print(dataset)으로, 특정 컬럼 값은 dataset["label"]처럼 접근해요. 첫 몇 개 행은 dataset[:n] 또는 인덱스로 확인해요.
print(dataset)
# Dataset({features: ['text', 'label'], num_rows: 8530})
print(dataset["text"][0])
가공
처리 메서드는 전부 새 객체를 반환해요. 필터·셔플·선택을 조합해 필요한 부분만 남길 수 있어요.
small = dataset.select([0, 10, 20, 30])
start_ar = dataset.filter(lambda e: e["text"].startswith("A"))
다음은?
본격적으로 쓰기 전에 이렇게 진행하는 걸 권장해요.
- 데이터셋 불러오기 → Load from Hub
- 가공 → Process
- 대용량 처리 → Streaming
- Hub에 공유 →
push_to_hub()사용법은 process 문서 참고.
더 알아보기
- 시작하기: Datasets Overview
- Hub에서 불러오기: Load from Hub
- 처리: Process