Kedro 데이터 카탈로그

Kedro 데이터 카탈로그

데이터 카탈로그(Data Catalog)는 파이프라인에서 쓰는 모든 데이터셋을 한곳에서 등록·관리하는 Kedro의 핵심 개념이에요. 데이터셋이 어디에 있고(위치), 어떤 형식·파일 타입인지(포맷)를 카탈로그에 선언해 두면, 노드의 입출력 이름이 그 데이터셋 정의와 연결돼요.

출처: Kedro Data Catalog

카탈로그에 데이터셋 등록

카탈로그는 보통 YAML 파일(conf/base/catalog.yml)로 정의해요. 데이터셋마다 파일 경로와 로드 방식을 지정해요.

raw_data:
  type: pandas.CSVDataSet
  filepath: data/01_raw/raw.csv

여기서 raw_data는 노드에서 쓰는 데이터셋 이름이고, type은 읽고 쓸 방식을, filepath는 실제 경로를 가리켜요.

데이터셋 관리의 이점

  • 중앙 관리 — 데이터셋의 위치·포맷을 한 파일에서 관리
  • 노드와 분리 — 코드에서 데이터 위치를 하드코딩하지 않아도 됨
  • 환경별 전환 — 개발/프로덕션 설정을 분리해서 같은 코드로 다른 데이터 사용

Kedro가 기본 제공하는 데이터셋 유형(예: pandas.CSVDataSet)이 많아서 파일 저장, DB, 클라우드 스토리지까지 폭넓게 다룰 수 있어요.

동적 데이터셋

런타임에 값이 정해지는 데이터셋(예: 매번 다른 날짜 파일)은 동적 데이터셋으로 표현할 수 있어요. 파티션 기반 데이터셋처럼 시간이나 카테고리로 나뉜 데이터를 다룰 때 유용해요.

더 알아보기