퀵스타트(Quickstart)

퀵스타트(Quickstart)

Datasets를 처음 쓴다면, 데이터셋을 불러와 탐색하고 간단히 가공하는 기본 흐름을 익히면 좋아요. load_dataset()으로 불러오고, 분할·구성(설정)을 확인하고, 필요하면 필터나 변환을 적용해요. 이 퀵스타트는 load_dataset()의 기본 쓰임새를 중심으로 안내해요.

데이터셋 로드

load_dataset()에 Hub 데이터셋 id를 넘기면 됩니다. 분할을 지정하면 Dataset, 지정하지 않으면 DatasetDict가 돌아와요.

from datasets import load_dataset

# 특정 분할만
dataset = load_dataset("cornell-movie-review-data/rotten_tomatoes", split="train")

# 전체 분할
ddict = load_dataset("cornell-movie-review-data/rotten_tomatoes")

출처: https://huggingface.co/docs/datasets/en/quickstart

탐색

로드한 Dataset은 pandas처럼 취급할 수 있어요. 컬럼명·행 수는 print(dataset)으로, 특정 컬럼 값은 dataset["label"]처럼 접근해요. 첫 몇 개 행은 dataset[:n] 또는 인덱스로 확인해요.

print(dataset)
# Dataset({features: ['text', 'label'], num_rows: 8530})
print(dataset["text"][0])

가공

처리 메서드는 전부 새 객체를 반환해요. 필터·셔플·선택을 조합해 필요한 부분만 남길 수 있어요.

small = dataset.select([0, 10, 20, 30])
start_ar = dataset.filter(lambda e: e["text"].startswith("A"))

다음은?

본격적으로 쓰기 전에 이렇게 진행하는 걸 권장해요.

  1. 데이터셋 불러오기Load from Hub
  2. 가공Process
  3. 대용량 처리Streaming
  4. Hub에 공유push_to_hub() 사용법은 process 문서 참고.

더 알아보기