커스텀 메트릭 거버넌스 모범 사례
커스텀 메트릭 거버넌스 모범 사례 (Best Practices for Custom Metrics Governance)
클라우드 기반 애플리케이션이 만들어 내는 데이터는 어마어마하고, 관측성(observability) 비용도 함께 커지기 마련이에요. 비용 부담이 커지면 많은 팀이 '수집하는 메트릭 수를 줄이는' 쪽으로 가고 싶어 하죠. 하지만 중앙집중식 SRE·관측성 팀의 입장에서, 효과적인 커스텀 메트릭 거버넌스는 가시성을 아예 끊는 것이 아니라 모니터링 효율을 높이는 방향이어야 해요.
이 가이드에서는 효과적인 메트릭 거버넌스의 세 가지 핵심 요소인 가시성과 귀속(Visibility and Attribution), 실행 가능한 커스텀 메트릭 거버넌스(Actionable Custom Metrics Governance), 모니터링과 예방(Monitoring and Prevention) 을 통해 커스텀 메트릭 볼륨을 관리하는 모범 사례를 다룹니다.
출처: 문서
본문
개요 (Overview)
클라우드 기반 애플리케이션은 엄청난 양의 데이터를 만들고 관측성 비용도 커져서, 결국 조직이 이 예산 항목을 줄여야 한다는 압박을 받게 돼요. 관측성 비용을 줄이기 위해 많은 팀이 수집하는 메트릭 수를 줄이는 쪽을 택하지만, 중앙집중식 SRE·관측성 팀에게는 효과적인 커스텀 메트릭 거버넌스가 가시성을 완전히 끊기보다는 모니터링 효율을 높여야 합니다.
이 가이드는 효과적인 메트릭 거버넌스의 세 가지 핵심 요소를 통해 커스텀 메트릭 볼륨을 관리하는 모범 사례를 보여 줘요. 각 핵심 요소에 대해 Datadog 도구를 비용 효율적으로 사용하는 방법을 배워 봅시다.
- 메트릭 사용량과 비용 찾고 이해하기
- 가장 큰 비용 요인 파악하기
- 가장 큰 비용 요인을 책임이 있는 팀·서비스에 귀속시키기
- 가치가 낮고 사용되지 않는 메트릭의 비용 줄이기
- 청구 초과가 발생하기 전에 사용량 모니터링하고 통제하기
Datadog의 커스텀 메트릭 거버넌스 도구에 대한 인터랙티브 워크스루도 확인해 보세요.
사전 요구사항 (Prerequisites)
⚠️ 주의 — 일부 제품 기능은 관리자(Administrator) 액세스가 필요해요.
이 가이드는 커스텀 메트릭에서 다음 개념을 이해하고 있다고 가정합니다.
가시성과 귀속 (Visibility and attribution)
커스텀 메트릭 볼륨과 비용을 관리하는 첫 단계는 핵심 비용 요인이 무엇인지 이해하고, 그 요인을 각각의 소유자에게 귀속시키는 것이에요.
이 섹션의 단계를 따라 계정 전체의 월간 메트릭 사용량을 검토하고, 팀별 또는 선택한 태그 키별로 계정 사용량을 세분화해 보세요.
계정 수준 가시성 (Account-level visibility)
⚠️ 주의 — Plan & Usage 페이지에 접근하려면 Datadog Admin 역할이 있어야 해요.
Plan and Usage는 계정의 월간 청구 가능 커스텀 메트릭 사용량을 기본 제공(OOTB) 요약으로 보여 주며, 비용, 소진율(burn rate), 상위 커스텀 메트릭 이름에 대한 상세 인사이트를 제공합니다.
- Plan & Usage 페이지에서 Usage Summary 섹션까지 스크롤하세요.
- Custom Metrics 탭을 클릭해 조직의 청구 가능 커스텀 메트릭 사용량, 사용량 추이, 상위 커스텀 메트릭 이름을 확인하세요.
- *Top Custom Metrics for *까지 스크롤해 커스텀 메트릭 비용에 기여하는 비율(%)이 있는 상위 메트릭 이름을 보세요.
계정의 월간 사용량과 비용에 가장 크게 기여하는 메트릭이 무엇인지 아는 것이 Metrics without Limits™를 사용하기 위한 권장 출발점이에요. 이 정보를 바탕으로 팀, 서비스, 조직 또는 기타 태그 속성별로 이 메트릭 제출의 출처를 찾을 수 있습니다.
또한 Usage Attribution 정보를 검토해 계정의 청구 가능 사용량을 태그 키별로 전체 세분화해 보세요. 여기서 team, service, application 같은 태그 기준으로 가장 큰 비용 요인을 식별할 수 있어요.
참고: Usage Attribution은 Enterprise 플랜에 포함된 고급 기능이에요. 다른 플랜에서는 이 기능을 요청하려면 계정 담당자나 Customer Success에 문의하세요.
메트릭 수준 가시성 (Metric-level visibility)
계정의 월간 사용량과 비용을 끌어올리고 있는 메트릭 이름을 파악했다면, 해당 메트릭의 상세 사이드 패널로 이동해 Custom Metrics Tags Cardinality Explorer를 볼 수 있어요. 이 화면은 어떤 태그 키가 특정 메트릭의 카디널리티(cardinality)를 급증시키는지 보여 줍니다. 고유 태그 값 수가 크게 늘어난 스팸성이거나 무제한(bounded)이지 않은 태그 키가 원인일 가능성이 높죠. Metrics without Limits™로 이 태그를 제외하면 즉시 비용을 절감할 수 있어요.
팀 수준 가시성과 귀속 (Team-level visibility and attribution)
팀 수준 가시성은 계정 관리자가 팀에 책임을 물을 수 있게 해 줘요. 더 중요한 건, 팀이 자신의 메트릭 볼륨 영향도를 이해하고 줄일 기회를 얻는다는 점입니다.
개별 팀은 자신이 제출하는 메트릭과 태그의 비용에 대한 인사이트가 제한적일 수 있어요. 그러다 보면 팀이 사용량을 통제하거나 사용량 증가를 제한할 동기가 약해지죠. 모두가 자신의 사용량을 볼 수 있고 그 볼륨과 비용을 관리하는 데 주인의식을 가질 수 있게 하는 것이 중요합니다.
가장 큰 커스텀 메트릭의 출처 찾기 (Find the source of your largest custom metrics)
⚠️ 주의 — Plan & Usage 페이지에 접근하려면 Datadog Admin 역할이 있어야 해요.
상위 커스텀 메트릭 이름을 책임지고 있는 팀이나 서비스를 식별하려면:
- Plan & Usage 페이지에서 Usage Summary 섹션까지 스크롤하세요.
- Custom Metrics 탭을 클릭해 조직의 청구 가능 사용량, 사용량 추이, 상위 커스텀 메트릭을 확인하세요.
- Top Custom Metrics for 표 아래에서 상위 커스텀 메트릭의 See in Metrics Summary 아이콘을 클릭하세요. 메트릭 상세 사이드 패널이 열린 Metrics Summary 페이지로 이동합니다.
- 사이드 패널에서 Tags 섹션까지 스크롤해 teams, service 같은 연결된 태그를 확인하세요.
내 팀의 커스텀 메트릭 보기 (View your team's custom metrics)
모든 팀은 청구 급증을 일으키는 메트릭을 실시간으로 볼 수 있어야 하고, 자신의 비용 최적화 노력이 다른 팀의 가시성에 영향을 주지 않는다는 확신도 가져야 해요.
팀이 제출하는 활성 보고 메트릭 이름을 모두 보려면, Metrics Summary 페이지로 이동해 Filter by Tag Value 필드에 태그 키-값 쌍(예: team:dev 또는 service:demo)을 입력하세요.
청구에 가장 큰 영향을 주는 팀의 메트릭 식별하기 (Identify any team's metrics that have the biggest impact on your bill)
조직의 모든 사용자는 Metrics Volume Management 페이지에서 기본 제공되는 실시간 추정 커스텀 메트릭 사용량을 볼 수 있어요. Datadog의 인텔리전트 인사이트는 비용 최적화 노력을 집중해야 할 메트릭을 식별하는 데 도움을 줍니다. Metrics Volume Management를 Metrics without Limits™와 함께 사용하면 인덱싱된 커스텀 메트릭 사용량을 통제하고 정확도를 희생하지 않으면서 비용을 줄일 수 있어요.
Metrics Volume Management를 통해 조직의 가장 큰 메트릭과 볼륨이 급증하는 메트릭 이름(예상치 못한 초과 청구의 유력 원인)을 식별할 수 있습니다.
자세한 내용은 Metrics Volume Management 문서를 참고하세요.
가치 기반 메트릭 거버넌스 (Value-based metrics governance)
효과적인 커스텀 메트릭 거버넌스는 모니터링 효율을 높여야 해요. 사용량이 무엇인지 이해하고 사용량을 출처에 귀속시킨 뒤에는, 메트릭을 줄이기 위한 조치를 취할 차례입니다.
이 섹션에서는 팀이 적극적으로 의존하는 가시성을 희생하지 않으면서, 관측성 비용에서 얻는 ROI와 가치를 극대화하기 위해 취할 수 있는 조치를 배워 봅시다.
Metrics without Limits™
Datadog의 Metrics without Limits™는 메트릭 수집(ingestion)과 인덱싱(indexing)을 분리하는 업계 최초의 비용 관리 기능이에요. 모든 메트릭이 매 순간 동등하게 가치 있는 것은 아니며, Metrics without Limits™를 쓰면 가치 있는 메트릭에 대해서만 비용을 지불하게 됩니다.
쿼리용으로 보존하고 싶은 태그 구성을 설정하면 어떤 메트릭 이름이든 인덱싱된 커스텀 메트릭 볼륨을 줄일 수 있어요. 비용이 줄고, 구성한 메트릭의 수학적 정확성은 보존됩니다(코드 수준 변경 없이 플랫폼 안에서 전부 해결되죠).
Metrics without Limits™를 사용하면 Datadog이 자동으로 다음을 제공해요.
- 활발히 쿼리되는 태그와 자산에 사용된 태그를 바탕으로 한 최신 권장 태그 구성(인텔리전트 쿼리 인사이트 기반) — 관측성 비용에서 ROI와 가치를 극대화하는 데 도움을 줍니다.
- Datadog에 제출된 어떤 메트릭에든 모든 사용자 상호작용(앱 내, API를 통한 것 모두)을 지속적으로 계산·분석하는 인텔리전트 쿼리 인사이트 — 권장 태그 구성이 항상 관련성을 유지하게 합니다.
- 언제든 변경을 롤백해 원래 제출한 모든 데이터에 대한 전체 가시성을 확보할 수 있는 기능.
Datadog의 메트릭 거버넌스 모범 사례의 일환으로, 상위 커스텀 메트릭에 Metrics without Limits를 먼저 사용해 보세요.
자세한 내용은 Metrics without Limits™ 문서를 참고하세요.
RBAC로 관측성을 줄이는 의도치 않은 구성 방지하기 (Prevent unintentional configurations that reduce observability with RBAC)
Metrics without Limits™를 사용하면 인덱싱하는 데이터를 줄여 메트릭 비용을 낮출 수 있어요. 잘못 사용하면 구성이 예상치 못한 사용량 급증이나, 더는 인덱싱되지 않는 태그로 인한 가시성 손실로 이어질 수 있죠. 예상치 못한 변경을 막으려면 RBAC 권한을 사용하세요. 기존 사용자 역할을 편집해 metrics_tags_write 권한을 포함시키거나, 커스텀 역할을 만들 수 있어요. 이렇게 하면 메트릭 카디널리티에 영향을 줄 수 있는 구성원과 Metrics without Limits™ 태그 구성을 바꿀 수 있는 구성원을 조직이 더 잘 통제할 수 있습니다.
Datadog은 모든 Metrics without Limits™ 구성의 감사 추적(audit trail)을 제공해요 — 어떤 구성이 어떤 사용자에 의해 만들어졌는지 상세히 알려 주므로, 커스텀 메트릭 사용량의 급증이나 하락을 귀속시킬 수 있습니다. 감사 추적 이벤트를 보려면 Events Explorer에 다음 쿼리를 입력하세요:
tags:audit "Queryable tag configuration"
쿼리되지 않거나 사용되지 않는 메트릭의 비용 줄이기 (Reduce costs from unqueried and unused metrics)
쿼리되지 않는 메트릭 (Unqueried metrics)
비용을 줄이면서 소중한 가시성을 제거하지 않도록 하려면 Query Activity 패싯(facet)을 사용하세요. 이 패싯은 팀이 의존하는 활발히 쿼리되는 메트릭과, Datadog 어디에서도 or API를 통해서도 쿼리되지 않는 메트릭을 구분해 줍니다. Datadog의 인텔리전트 쿼리 인사이트는 어떤 메트릭에든 모든 사용자 상호작용(Datadog 안 또는 API를 통한 것)을 지속적으로 계산·분석해 쿼리되지 않는 메트릭을 식별하는 데 도움을 줍니다.
참고: 쿼리되지 않는 메트릭은 자산(대시보드, 노트북, 모니터, SLO) 쿼리에는 사용될 수 있어요. 주어진 시간 범위 안에 자산이 사용되지 않았다면 해당 메트릭은 쿼리되지 않는 것으로 간주됩니다.
사용되지 않는 메트릭 (Unused metrics)
Related Assets 패싯을 사용하면 의도치 않은 부작용 없이 비용을 줄일 수도 있어요. 이 패싯을 사용하면 어떤 자산(대시보드, 노트북, 모니터, SLO)에서도 사용되지 않는 메트릭을 식별할 수 있습니다. 메트릭 구성에 대해 정보에 기반한 결정을 내리는 데 도움이 되죠.
모든 쿼리되지 않고 사용되지 않는 메트릭 식별하기 (Identify all unqueried and unused metrics)
Related Assets 패싯을 사용해 Datadog에서 사용되지 않는 메트릭에 대한 가시성을 확보하면, 자산을 실수로 망가뜨리지 않으면서 비용을 줄일 수 있어요. 이 패싯은 대시보드, 노트북, 모니터, SLO에서 어떤 메트릭이 사용되는지 보여 주므로, 메트릭 구성에 대해 정보에 기반한 결정을 내릴 수 있습니다.
조직의 쿼리되지 않고 사용되지 않는 메트릭 전체 목록을 식별하려면:
- Metrics Summary 페이지 왼쪽에서 Query Activity 패싯을 찾으세요. 관심 있는 시간 범위(30, 60, 90일)를 선택하세요.
- 왼쪽에서 Related Assets 패싯을 찾아 Not used in any asset을 선택하세요.
- 왼쪽에서 Configuration 패싯을 찾아 All Tags를 선택하세요. 이 세 패싯의 조합으로, 쿼리되지 않거나 자산에 사용되지 않으면서 이미 커스텀 태그 구성도 없는 메트릭 목록을 얻을 수 있어요.
- 결과로 나온 메트릭 이름 표를 검토하세요. 특정 패턴이 있거나 특정 서비스에서 제출된 건가요? 이 쿼리되지 않는 메트릭과 연결된 태그를 찾아보세요.
- (선택) 이 목록을 내보내려면 메트릭 표 위의 Export as CSV를 클릭하세요.
개발자가 필요로 하지 않는 메트릭을 식별한 뒤에는 Metrics without Limits™로 이 사용되지 않는 메트릭의 커스텀 메트릭 볼륨과 관련 비용을 안전하게 줄일 수 있어요.
Metrics Summary 페이지 상단에서 Configure Metrics 드롭다운 메뉴를 클릭하세요. Manage tags를 선택해 Metrics without Limits™ Tag configuration 모달을 열어 여러 메트릭을 일괄 구성하세요. 구성하려는 메트릭의 메트릭 네임스페이스 접두사를 지정하세요. Include tags를 선택된 상태로 두세요. 이렇게 하면 자산(대시보드, 노트북, 모니터, SLO)과 Metrics Explorer, API에서 활발히 쿼리된 모든 태그가 포함됩니다. Save를 클릭하세요.
수천 개의 커스텀 메트릭 고객에 대한 Datadog의 인텔리전트 쿼리 인사이트에 따르면, 쿼리되지 않는 메트릭에 Metrics without Limits™를 사용하면 평균 고객의 커스텀 메트릭 사용량을 최대 70%까지 줄일 수 있어요.
메트릭의 상대적 유용성 이해하기 (Understand the relative utility of your metrics)
메트릭이 지난 30, 60, 90일 동안 쿼리되지 않았더라도, 팀은 인시던트 관리와 장애 대응(remediation)에서 여전히 가치를 얻을 수 있어요. 반대로 팀이 기존의 활발히 쿼리되는 메트릭을 충분히 활용하지 못하고 있을 수도 있죠. 그래서 거버넌스 워크플로의 다음 권장 단계는 메트릭의 상대적 유용성을 이해하는 것입니다.
Datadog의 Metrics without Limits™는 기능 모음으로, Metrics Related Assets 사이드 패널로 활발히 쿼리되는 메트릭의 가치를 평가하는 기본 제공 인사이트도 제공해요. 메트릭 관련 자산(metric related asset)은 특정 메트릭을 쿼리하는 대시보드, 노트북, 모니터, SLO 같은 Datadog 자산을 말해요. Tags 열을 사용해 어떤 특정 태그가 자산에 사용되는지 식별하면, Metrics without Limits™로 최적화할 때 가시성을 유지할 수 있습니다. 관련 자산의 인기도와 수량을 사용해 조직 내 메트릭 유용성을 평가하고, 데이터 기반 결정을 내릴 수 있어요. 팀이 기존 메트릭을 어떻게 사용해 관측성 비용에서 더 많은 가치를 얻을 수 있는지 더 잘 이해할 수 있습니다.
메트릭의 관련 자산을 보려면:
- 메트릭 이름을 클릭해 상세 사이드 패널을 여세요.
- 사이드 패널의 Related Assets 섹션까지 스크롤하세요.
- 드롭다운 버튼을 클릭해 관심 있는 관련 자산 유형(대시보드, 모니터, 노트북, SLO)을 보세요. 검색창으로 특정 자산을 확인할 수도 있습니다.
모니터링과 예방 (Monitoring and prevention)
이 섹션에서는 다음 방법을 배워 봅시다.
- 계정 전체의 커스텀 메트릭 사용량 초과와 갑작스러운 급증에 알림 설정하기
- 향후 메트릭 성장 예측하고 예상치 못한 전체 편차에 알림 설정하기
- 특정 메트릭의 카디널리티가 사용자 정의 임계값을 초과하거나 비정상적으로 급증할 때 알림 설정하기
계정의 메트릭 사용량과 그 비용을 책임지는 팀을 파악한 뒤에는, 커스텀 메트릭 사용량이 특정 임계값을 초과할 때 알림을 주도록 모니터를 만들어 보세요. 커스텀 메트릭 사용량 급증에 대한 알림을 받으면 의도치 않은 청구 급증을 예방할 수 있어요.
Datadog은 추정 커스텀 메트릭 사용량을 측정하는 기본 제공 메트릭을 제공해요. 이 메트릭을 대시보드 시각화와 모니터 알림에 사용할 수 있습니다.
| 사용 유형 | 메트릭 | 설명 |
|---|---|---|
| 인덱싱된 커스텀 메트릭 (Indexed Custom Metrics) | datadog.estimated_usage.metrics.custom, datadog.estimated_usage.metrics.custom.by_metric, datadog.estimated_usage.metrics.custom.by_tag |
지난 1시간 동안 보인 고유 인덱싱 커스텀 메트릭. |
| 수집된 커스텀 메트릭 (Ingested Custom Metrics) | datadog.estimated_usage.metrics.custom.ingested, datadog.estimated_usage.metrics.custom.ingested.by_metric, datadog.estimated_usage.metrics.custom.ingested.by_tag |
지난 1시간 동안 보인 고유 수집 커스텀 메트릭. |
초과 청구를 막기 위한 커스텀 메트릭 사용량 급증 모니터링 (Monitor spikes in custom metric usage to prevent overages)
대시보드 타임시리즈 위젯이나 메트릭 모니터로 메트릭 이름별 실시간 추정 커스텀 메트릭 사용량 세분화를 볼 수도 있어요. datadog.estimated_usage.metrics.custom.by_metric 메트릭으로 모니터를 만들어, 각 메트릭 이름의 볼륨에 대한 최신 가시성을 항상 유지할 수 있습니다.
추가 모니터링 사용 사례 (Additional monitoring use cases)
알림을 받은 뒤에는 Metrics Volume Management 페이지로 급증하는 메트릭의 태그 키를 검사하고, Metrics without Limits™로 급증을 일으키는 비정상 태그 키를 즉시 제거하세요. 이렇게 하면 의도치 않은 청구 급증을 즉시 해결할 수 있습니다.
추정 사용량 메트릭으로 모니터를 만들 수 있는 추가 사용 사례:
모범 사례 요약 (Summary of best practices)
- 가장 큰 메트릭 이름(상위 커스텀 메트릭 표 또는 Metrics Volume 페이지)을 식별하는 것부터 시작해, 이 상위 메트릭을 가장 비용 효율적인 볼륨으로 최적화하기 위해 Metrics without Limits™를 사용하세요.
- Metrics Volume Management 페이지로 기존 커스텀 메트릭 사용량 급증을 그 급증을 일으키는 상위 급증 메트릭 이름에 귀속시키세요.
- 즉각적인 비용 절감을 위해 쿼리되지 않는 커스텀 메트릭을 식별하고, Metrics without Limits™로 이 메트릭들을 빈 태그 구성으로 설정하세요.
- Datadog의 기본 제공 추정 커스텀 메트릭 사용량 메트릭 중 하나를 사용해 커스텀 메트릭 사용량에 모니터를 설정하세요.