버킷 정렬 집계
버킷 정렬 집계 (Bucket sort aggregation)
bucket_sort 집계는 부모 다중 버킷 집계가 생성한 버킷을 정렬하거나 자르는(truncate) 부모(parent) 집계예요.
bucket_sort 집계에서는 여러 필드로, 각각 고유한 정렬 순서로 버킷을 정렬할 수 있어요. 버킷은 키, 문서 수 또는 하위 집계의 값으로 정렬할 수 있어요. 또한 from과 size 파라미터를 사용해 정렬 유무와 관계없이 결과를 자를 수 있어요.
정렬 순서 지정에 대한 자세한 내용은 결과 정렬(Sort results) 문서를 참고하세요.
출처: 문서
본문
파라미터
bucket_sort 집계는 다음과 같은 파라미터를 받아요.
| 파라미터 | 필수/선택 | 데이터 타입 | 설명 |
|---|---|---|---|
gap_policy |
선택 | String | 누락 데이터에 적용할 정책이에요. 유효한 값은 skip과 insert_zeros예요. 기본값은 skip이에요. 데이터 공백(Data gaps) 문서를 참고하세요. |
sort |
선택 | String | 정렬할 필드 목록이에요. 결과 정렬(Sort results) 문서를 참고하세요. |
from |
선택 | String | 반환할 첫 번째 결과의 인덱스예요. 음수가 아닌 정수여야 해요. 기본값은 0이에요. from 및 size 파라미터 문서를 참고하세요. |
size |
선택 | String | 반환할 최대 결과 수예요. 양의 정수여야 해요. from 및 size 파라미터 문서를 참고하세요. |
sort, from, size 중 하나 이상은 반드시 제공해야 해요.
예제
다음 예제는 OpenSearch Dashboards e-커머스 샘플 데이터에서 한 달 간격의 날짜 히스토그램을 생성해요. sum 하위 집계가 매월 모든 바이트의 합계를 계산해요. 마지막으로 집계가 바이트 수를 기준으로 버킷을 내림차순으로 정렬해요:
GET opensearch_dashboards_sample_data_logs/_search
{
"size": 0,
"aggs": {
"sales_per_month": {
"date_histogram": {
"field": "@timestamp",
"calendar_interval": "month"
},
"aggs": {
"total_bytes": {
"sum": {
"field": "bytes"
}
},
"bytes_bucket_sort": {
"bucket_sort": {
"sort": [
{ "total_bytes": { "order": "desc" } }
]
}
}
}
}
}
}
예제 응답
집계는 버킷을 총 바이트 수의 내림차순으로 재정렬해요:
{
"took": 3,
"timed_out": false,
"_shards": {
"total": 1,
"successful": 1,
"skipped": 0,
"failed": 0
},
"hits": {
"total": {
"value": 10000,
"relation": "gte"
},
"max_score": null,
"hits": []
},
"aggregations": {
"sales_per_month": {
"buckets": [
{
"key_as_string": "2025-05-01T00:00:00.000Z",
"key": 1746057600000,
"doc_count": 7072,
"total_bytes": {
"value": 40124337
}
},
{
"key_as_string": "2025-06-01T00:00:00.000Z",
"key": 1748736000000,
"doc_count": 6056,
"total_bytes": {
"value": 34123131
}
},
{
"key_as_string": "2025-04-01T00:00:00.000Z",
"key": 1743465600000,
"doc_count": 946,
"total_bytes": {
"value": 5478221
}
}
]
}
}
}
예제: 결과 자르기 (Truncating the results)
결과를 자르려면 from 및/또는 size 파라미터를 제공해요. 다음 예제는 동일한 정렬을 수행하지만 두 번째 버킷부터 시작해 두 개의 버킷을 반환해요:
GET opensearch_dashboards_sample_data_logs/_search
{
"size": 0,
"aggs": {
"sales_per_month": {
"date_histogram": {
"field": "@timestamp",
"calendar_interval": "month"
},
"aggs": {
"total_bytes": {
"sum": {
"field": "bytes"
}
},
"bytes_bucket_sort": {
"bucket_sort": {
"sort": [
{ "total_bytes": { "order": "desc" } }
],
"from": 1,
"size": 2
}
}
}
}
}
}
집계는 정렬된 두 버킷을 반환해요:
{
"took": 2,
"timed_out": false,
"_shards": {
"total": 1,
"successful": 1,
"skipped": 0,
"failed": 0
},
"hits": {
"total": {
"value": 10000,
"relation": "gte"
},
"max_score": null,
"hits": []
},
"aggregations": {
"sales_per_month": {
"buckets": [
{
"key_as_string": "2025-06-01T00:00:00.000Z",
"key": 1748736000000,
"doc_count": 6056,
"total_bytes": {
"value": 34123131
}
},
{
"key_as_string": "2025-04-01T00:00:00.000Z",
"key": 1743465600000,
"doc_count": 946,
"total_bytes": {
"value": 5478221
}
}
]
}
}
}
정렬 없이 결과만 자르려면 sort 파라미터를 생략해요:
GET opensearch_dashboards_sample_data_logs/_search
{
"size": 0,
"aggs": {
"sales_per_month": {
"date_histogram": {
"field": "@timestamp",
"calendar_interval": "month"
},
"aggs": {
"total_bytes": {
"sum": {
"field": "bytes"
}
},
"bytes_bucket_sort": {
"bucket_sort": {
"from": 1,
"size": 2
}
}
}
}
}
}