확장 통계 버킷 집계

확장 통계 버킷 집계 (Extended stats bucket aggregation)

extended_stats_bucket 집계는 stats_bucket 형제 집계를 더 포괄적으로 확장한 버전이에요. stats_bucket이 제공하는 기본 통계량에 더해 extended_stats_bucket은 다음 메트릭까지 계산해요:

  • 제곱합 (Sum of squares)
  • 분산 (Variance)
  • 모분산 (Population variance)
  • 표본 분산 (Sampling variance)
  • 표준편차 (Standard deviation)
  • 모표준편차 (Population standard deviation)
  • 표본 표준편차 (Sampling standard deviation)
  • 표준편차 경계 (Standard deviation bounds): 상한(Upper), 하한(Lower), 모집단 상한(Population upper), 모집단 하한(Population lower), 표본 상한(Sampling upper), 표본 하한(Sampling lower)

표준편차와 분산은 모집단 통계량(population statistics)이에요. 즉 항상 각각 모표준편차와 모분산과 같아요.

std_deviation_bounds 객체는 평균을 기준으로 위아래로 지정된 표준편차 개수만큼의 범위를 정의해요(기본값은 2 표준편차). 이 객체는 항상 출력에 포함되지만, 정규 분포를 따르는 데이터에서만 의미가 있어요. 이 값을 해석하기 전에 데이터셋이 정규 분포를 따르는지 먼저 확인하세요.

지정된 메트릭은 숫자여야 하고, 형제 집계는 다중 버킷(multi-bucket) 집계여야 해요.

출처: 문서

본문

파라미터

extended_stats_bucket 집계는 다음과 같은 파라미터를 받아요.

파라미터 필수/선택 데이터 타입 설명
buckets_path 필수 String 집계할 버킷의 경로예요. 버킷 경로(Buckets path) 문서를 참고하세요.
gap_policy 선택 String 누락 데이터에 적용할 정책이에요. 유효한 값은 skip과 insert_zeros예요. 기본값은 skip이에요. 데이터 공백(Data gaps) 문서를 참고하세요.
format 선택 String DecimalFormat 형식 문자열이에요. 집계의 <stat>_as_string 속성에 형식화된 출력을 반환해요.
sigma 선택 Double (음수 아님) std_deviation_bounds 구간을 계산할 때 평균 위아래로 사용할 표준편차의 개수예요. 기본값은 2예요. extended_stats의 경계 정의(Defining bounds) 섹션을 참고하세요.

예제

다음 예제는 OpenSearch Dashboards e-커머스 샘플 데이터를 사용해 한 달 간격의 날짜 히스토그램을 생성해요. sum 하위 집계가 매월 모든 바이트의 합계를 계산해요. 마지막으로 extended_stats_bucket 집계가 이 합계들에 대한 확장 통계를 반환해요:

GET opensearch_dashboards_sample_data_logs/_search
{
  "size": 0,
  "aggs": {
    "visits_per_month": {
      "date_histogram": {
        "field": "@timestamp",
        "interval": "month"
      },
      "aggs": {
        "sum_of_bytes": {
          "sum": {
            "field": "bytes"
          }
        }
      }
    },
    "stats_monthly_bytes": {
      "extended_stats_bucket": {
        "buckets_path": "visits_per_month>sum_of_bytes",
        "sigma": 3,
        "format": "0.##E0"
      }
    }
  }
}

예제 응답

응답에는 선택된 버킷에 대한 확장 통계가 포함돼요. 표준편차 경계는 3시그마 범위에 대한 것이라는 점에 주목하세요. sigma를 바꾸거나(또는 기본값 2로 두거나) 하면 다른 결과가 반환돼요:

{
  "took": 6,
  "timed_out": false,
  "_shards": {
    "total": 1,
    "successful": 1,
    "skipped": 0,
    "failed": 0
  },
  "hits": {
    "total": {
      "value": 10000,
      "relation": "gte"
    },
    "max_score": null,
    "hits": []
  },
  "aggregations": {
    "visits_per_month": {
      "buckets": [
        {
          "key_as_string": "2025-03-01T00:00:00.000Z",
          "key": 1740787200000,
          "doc_count": 480,
          "sum_of_bytes": {
            "value": 2804103
          }
        },
        {
          "key_as_string": "2025-04-01T00:00:00.000Z",
          "key": 1743465600000,
          "doc_count": 6849,
          "sum_of_bytes": {
            "value": 39103067
          }
        },
        {
          "key_as_string": "2025-05-01T00:00:00.000Z",
          "key": 1746057600000,
          "doc_count": 6745,
          "sum_of_bytes": {
            "value": 37818519
          }
        }
      ]
    },
    "stats_monthly_bytes": {
      "count": 3,
      "min": 2804103,
      "max": 39103067,
      "avg": 26575229.666666668,
      "sum": 79725689,
      "min_as_string": "2.8E6",
      "max_as_string": "3.91E7",
      "avg_as_string": "2.66E7",
      "sum_as_string": "7.97E7",
      "sum_of_squares": 2967153221794459,
      "variance": 282808242095406.25,
      "variance_population": 282808242095406.25,
      "variance_sampling": 424212363143109.4,
      "std_deviation": 16816903.46334325,
      "std_deviation_population": 16816903.46334325,
      "std_deviation_sampling": 20596416.2694171,
      "std_deviation_bounds": {
        "upper": 77025940.05669643,
        "lower": -23875480.72336309,
        "upper_population": 77025940.05669643,
        "lower_population": -23875480.72336309,
        "upper_sampling": 88364478.47491796,
        "lower_sampling": -35214019.141584635
      },
      "sum_of_squares_as_string": "2.97E15",
      "variance_as_string": "2.83E14",
      "variance_population_as_string": "2.83E14",
      "variance_sampling_as_string": "4.24E14",
      "std_deviation_as_string": "1.68E7",
      "std_deviation_population_as_string": "1.68E7",
      "std_deviation_sampling_as_string": "2.06E7",
      "std_deviation_bounds_as_string": {
        "upper": "7.7E7",
        "lower": "-2.39E7",
        "upper_population": "7.7E7",
        "lower_population": "-2.39E7",
        "upper_sampling": "8.84E7",
        "lower_sampling": "-3.52E7"
      }
    }
  }
}

더 알아보기 (Learn more)