Apache Druid
Apache Druid
Apache® Druid는 대규모 데이터셋에서 빠른 슬라이스앤다이스 분석(OLAP 쿼리)을 위해 설계된 실시간 분석 데이터베이스예요. 실시간 수집, 빠른 쿼리 성능, 높은 가용성이 중요한 유스케이스에서 가장 자주 쓰이지요. 웨어하우스, 시계열 데이터베이스, 로그검색 시스템의 아이디어를 한데 모은 아키텍처로, 이벤트 중심 데이터에 가장 잘 맞아요.
핵심 개념
- 아키텍처(Architecture): 분산 서버들의 역할 분담과 deep storage 기반 장애 복구
- 세그먼트(Segments): 시간 단위로 분할되어 저장·색인되는 데이터 파일
- 데이터 수집(Ingestion): 스트리밍·배치 방식으로 데이터를 세그먼트로 만들어 저장
- 쿼리(Querying): Druid SQL과 네이티브 쿼리, 타임시리즈·TopN·GroupBy 쿼리
- 롤업(Rollup): 수집 시점의 사전 집계로 저장량을 크게 줄이는 요약 기법
이 카테고리의 문서
- 아키텍처·소개: Druid 소개, 세그먼트
- 데이터 수집: 수집 개요, 데이터 롤업
- 쿼리: 네이티브 쿼리, 타임시리즈 쿼리