데이터 수집
데이터 수집 (Ingestion)
Pinot 테이블로 데이터를 어떻게 들여올지, 배치·스트림·업서트와 같은 선택지를 미리 정리해 보는 페이지예요.
출처: Ingestion
본문
데이터 수집(Ingestion)은 Pinot 테이블이 실제로 살아 움직이게 만드는 단계예요. 여기에서부터 배치(batch) 또는 스트림(stream) 데이터 중 어떤 경로가 맞는지 고르고, 업서트(upsert), 중복 제거(dedup), 파일 포맷, 파일 시스템, 변환(transform), 집계(aggregation) 설계를 다듬어 나가면 돼요.
상세한 Controller와 테이블 설정 자료는 Reference에서 다룹니다. 이 섹션은 데이터 흐름과 운영 선택지에 집중해요.
시작하기 (Start Here)
- 배치 수집 - 파일로 도착하거나 웨어하우스 스타일 배치 흐름으로 들어오는 데이터용.
- 스트림 수집 - Kafka 스타일 또는 빠르게 쿼리 가능해야 하는 기타 이벤트 스트림용.
- 업서트와 중복 제거 - 키당 하나의 정식 로우(raw event history 대신)가 필요한 테이블용.
- 포맷과 파일시스템 - 소스 포맷, 파일 시스템, 딥스토리지 선택용.
- 변환과 집계 - 수집 시점의 정리와 사전 집계 결정용.
관련 기존 문서 (Related Existing Docs)
- Import Data
- 데이터 수집 개요 (Data Ingestion Overview)
- 수집 변환 (Ingestion Transformations)
- 수집 집계 (Ingestion Aggregations)
- 지원되는 데이터 포맷
- 파일 시스템
이 페이지가 다루는 내용
이 랜딩 페이지는 수집 하위 트리를 정의하고 주요 결정 페이지들을 가리켜 줘요.
다음 단계
소스 데이터가 파일이나 사전 구축된 세그먼트로 도착한다면 배치 수집을 읽어 보세요.