Kedro 데이터 카탈로그
Kedro 데이터 카탈로그
데이터 카탈로그(Data Catalog)는 파이프라인에서 쓰는 모든 데이터셋을 한곳에서 등록·관리하는 Kedro의 핵심 개념이에요. 데이터셋이 어디에 있고(위치), 어떤 형식·파일 타입인지(포맷)를 카탈로그에 선언해 두면, 노드의 입출력 이름이 그 데이터셋 정의와 연결돼요.
카탈로그에 데이터셋 등록
카탈로그는 보통 YAML 파일(conf/base/catalog.yml)로 정의해요. 데이터셋마다 파일 경로와 로드 방식을 지정해요.
raw_data:
type: pandas.CSVDataSet
filepath: data/01_raw/raw.csv
여기서 raw_data는 노드에서 쓰는 데이터셋 이름이고, type은 읽고 쓸 방식을, filepath는 실제 경로를 가리켜요.
데이터셋 관리의 이점
- 중앙 관리 — 데이터셋의 위치·포맷을 한 파일에서 관리
- 노드와 분리 — 코드에서 데이터 위치를 하드코딩하지 않아도 됨
- 환경별 전환 — 개발/프로덕션 설정을 분리해서 같은 코드로 다른 데이터 사용
Kedro가 기본 제공하는 데이터셋 유형(예: pandas.CSVDataSet)이 많아서 파일 저장, DB, 클라우드 스토리지까지 폭넓게 다룰 수 있어요.
동적 데이터셋
런타임에 값이 정해지는 데이터셋(예: 매번 다른 날짜 파일)은 동적 데이터셋으로 표현할 수 있어요. 파티션 기반 데이터셋처럼 시간이나 카테고리로 나뉜 데이터를 다룰 때 유용해요.
더 알아보기
- 데이터셋과 노드 연결: Nodes
- 실행 설정: Parameters