본문 바로가기
WIKI 기술 지식 베이스

서비스 점검 모니터

원문 보기 위키 갱신

Service check 모니터는 Agent에 포함된 1,000개 이상의 통합 항목 중 하나에서 보고되지 않는 모든 서비스 점검을 다뤄요. 서비스 점검은 커스텀 Agent 점검, DogStatsD, 또는 API를 사용해 Datadog로 보낼 수 있지요.

출처: 문서

본문

개요

Service check 모니터는 Agent에 포함된 1,000개 이상의 통합 항목 중 하나에서 보고되지 않는 모든 서비스 점검을 포함해요. 서비스 점검은 커스텀 Agent 점검, DogStatsD, 또는 API를 사용해 Datadog로 보낼 수 있어요. 자세한 내용은 Service Check Overview를 참고하세요.

모니터 생성

Datadog에서 service check monitor를 만들려면 메인 네비게이션을 사용하세요: Monitors –> New Monitor –> Service Check.

서비스 점검 선택

드롭다운 메뉴에서 서비스 점검을 선택하세요.

모니터 범위 선택

호스트 이름, 태그를 선택하거나 All Monitored Hosts를 선택해 모니터링할 범위를 선택하세요. 특정 호스트를 제외해야 한다면 두 번째 필드를 사용해 이름이나 태그를 나열하세요.

  • include 필드는 AND 로직을 사용해요. 나열된 모든 호스트 이름과 태그가 호스트에 존재해야 그 호스트가 포함돼요.
  • exclude 필드는 OR 로직을 사용해요. 나열된 호스트 이름이나 태그가 있는 호스트는 모두 제외돼요.

알림 조건 설정

이 섹션에서 Check Alert 또는 Cluster Alert 중 하나를 선택하세요.

{% tab title="Check Alert" %} Check alert는 각 점검 그룹별로 제출된 연속 상태를 추적하고 임계값과 비교해요.

Check alert를 설정하세요:

  1. 점검을 보고하는 각 <GROUP>에 대해 별도의 알림을 트리거해요.

    • 점검 그룹화는 알려진 그룹화 목록에서 지정하거나 사용자가 지정해요. Service check 모니터의 경우 점검별 그룹화가 알려져 있지 않으므로 직접 지정해야 해요.
  2. 선택한 연속 실패 이후에 알림을 트리거하세요: <NUMBER>

    • CRITICAL 상태를 가진 연속 실행이 몇 번이면 알림을 트리거할지 선택하세요. 예를 들어 점검이 실패할 때 즉시 알림을 받으려면 1개의 critical 상태에서 모니터 알림을 트리거하세요.
  3. Unknown 상태에 대해 Do not notify 또는 Notify를 선택하세요.

    • Notify를 선택하면 UNKNOWN으로의 상태 전이가 알림을 트리거해요. monitor status page에서 UNKNOWN 상태 그룹의 상태 표시줄은 NODATA 회색을 사용해요. 모니터의 전체 상태는 OK로 유지돼요.
  4. 선택한 연속 성공 이후에 알림을 해제하세요: <NUMBER>.

    • OK 상태를 가진 연속 실행이 몇 번이면 알림을 해제할지 선택하세요. 예를 들어 이슈가 해결되었는지 확인하려면 4개의 OK 상태에서 모니터를 해제하세요.

{% /tab %}

{% tab title="Cluster Alert" %} Cluster alert는 주어진 상태에 있는 점검의 백분율을 계산하고 임계값과 비교해요.

각각 다른 태그 조합으로 태그된 각 점검은 클러스터에서 별개의 점검으로 간주돼요. 각 태그 조합의 마지막 점검 상태만 클러스터 백분율 계산에 고려돼요.

{% image source="https://docs.dd-static.net/images/monitors/monitor_types/process_check/cluster_check_thresholds.a0293f2a3b0165cff25f7207d86b781f.png?auto=format&fit=max&w=850 1x, https://docs.dd-static.net/images/monitors/monitor_types/process_check/cluster_check_thresholds.a0293f2a3b0165cff25f7207d86b781f.png?auto=format&fit=max&w=850&dpr=2 2x" alt="Cluster Check Thresholds" /%}

예를 들어 환경으로 그룹화된 cluster check 모니터는 어떤 환경에서든 점검의 70% 이상이 CRITICAL 상태를 제출하면 알림을 보내고, 어떤 환경에서든 점검의 70% 이상이 WARN 상태를 제출하면 경고할 수 있어요.

Cluster alert를 설정하세요:

  1. 태그에 따라 점검을 그룹화할지 여부를 결정하세요. Ungrouped는 모든 소스에 걸쳐 상태 백분율을 계산해요. Grouped는 그룹별로 상태 백분율을 계산해요.

  2. alert 및 warn 임계값의 백분율을 선택하세요. 하나의 설정(alert 또는 warn)만 필요해요.

{% /tab %}

고급 알림 조건

No data, Auto resolve, New group delay 옵션에 대한 정보는 Monitor configuration 문서를 참고하세요.

알림

Configure notifications and automations 섹션에 대한 자세한 지침은 Notifications 페이지를 참고하세요.

더 알아보기 (Learn more)

추가로 도움이 되는 문서, 링크, 아티클: