DataSketches 확장 기능

DataSketches 확장 기능 (DataSketches extension)

이 확장 기능은 Apache DataSketches 라이브러리를 기반으로 한 애그리게이터들을 제공해요. 스케치(Sketch)는 근사적(approximate)이고 스트리밍 가능하며 병합 가능한 알고리즘을 구현하는 데이터 구조예요.

출처: 문서

본문

이 확장 기능은 Apache DataSketches 라이브러리를 기반으로 한 Apache Druid 애그리게이터들이에요. 스케치는 근사적 스트리밍 병합 알고리즘(approximate streaming mergeable algorithms)을 구현하는 데이터 구조예요. 스케치는 Druid 외부에서 인제스트하거나 인제이션 시점에 원시 데이터로부터 만들 수 있어요. 스케치는 additve 메트릭으로 Druid 세그먼트에 저장될 수 있어요.

datasketches 애그리게이터를 사용하려면 config 파일에 확장 기능을 포함하세요:

druid.extensions.loadList=["druid-datasketches"]

다음 모듈을 사용할 수 있어요:

  • Theta sketch — 집합 연산(union, intersection, set difference)을 지원하는 근사적 중복(distinct) 개수 세기.
  • Tuple sketch — 고유 키와 연관된 값(이 특수 구현에서는 숫자 값 배열)을 지원하도록 확장된 Theta sketch.
  • Quantiles sketch — 순위(ranks), 분위수(quantiles), 히스토그램을 얻기 위한 비교 가능한 값들의 근사적 분포. 숫자 값을 위한 특수 구현이에요.
  • KLL Quantiles sketch — 순위, 분위수, 히스토그램을 얻기 위한 비교 가능한 값들의 근사적 분포. 숫자 값을 위한 특수 구현이에요. 위의 고전적 quantiles보다 더 고급 알고리즘이며, 동일한 정확도에 대해 더 컴팩트하거나, 동일한 크기에 대해 더 정확한 스케치를 생성해요.
  • HLL sketch — 매우 컴팩트한 HLL 스케치를 사용한 근사적 중복 개수 세기.

더 알아보기 (Learn more)