호스트 모니터
인프라스트럭처 모니터링은 많은 통합 항목을 통해 클라우드 호스팅 및 온프레미스 서버를 포함한 전체 IT 환경에 대한 가시성을 제공해요. Host 모니터를 사용하면 어떤 호스트가 데이터를 제출하고 있는지, 또는 제출하지 않고 있는지 파악해 지속적인 가시성을 유지할 수 있어요.
출처: 문서
본문
개요
인프라스트럭처 모니터링은 많은 통합 항목을 통해 클라우드 호스팅 및 온프레미스 서버를 포함한 전체 IT 환경에 대한 가시성을 제공해요. Host 모니터를 사용하면 어떤 호스트가 데이터를 제출하고 있는지, 또는 제출하지 않고 있는지 파악해 지속적인 가시성을 유지할 수 있어요.
모든 Datadog Agent는 datadog.agent.up이라는 상태가 OK인 서비스 점검(service check)을 보고해요. 호스트 모니터를 사용해 하나 이상의 호스트에서 이 점검을 모니터링할 수 있어요.
{% alert level="danger" %}
AIX Agent는 datadog.agent.up 서비스 점검을 보고하지 않아요. datadog.agent.running 메트릭을 사용해 AIX Agent의 가동 시간을 모니터링할 수 있어요. Agent가 Datadog에 보고하고 있으면 이 메트릭은 1 값을 내보내요.
{% /alert %}
모니터 생성
Datadog에서 host monitor를 만들려면 메인 네비게이션을 사용하세요: Monitors > New Monitor > Host.
이름 또는 태그로 호스트 선택
호스트 이름, 태그를 선택하거나 All Monitored Hosts를 선택해 모니터링할 호스트를 선택하세요. 특정 호스트를 제외해야 한다면 두 번째 필드를 사용해 이름이나 태그를 나열하세요.
- include 필드는
AND로직을 사용해요. 나열된 모든 이름과 태그가 호스트에 존재해야 그 호스트가 포함돼요. - exclude 필드는
OR로직을 사용해요. 나열된 이름이나 태그가 있는 호스트는 모두 제외돼요.
예시
| 모니터 | Include | Exclude |
|---|---|---|
env:prod 태그가 있는 모든 호스트 포함 |
env:prod |
비워 둠 |
env:test 태그가 있는 호스트를 제외한 모든 호스트 |
All Monitored Hosts |
env:test |
알림 조건 설정
이 섹션에서 Check Alert 또는 Cluster Alert 중 하나를 선택하세요.
{% tab title="Check Alert" %} Check alert는 호스트가 주어진 시간 동안 보고를 중단했는지 추적해요. 점검 실행 후 지나치게 오래 지속되는 것은 호스트의 데이터 제출에 문제가 있다는 신호일 수 있어요.
누락 데이터를 확인할 시간(분)을 입력하세요. 기본값은 2분이에요.
datadog.agent.up이 지정된 시간(분)보다 오래 OK 상태 보고를 중단하면 알림이 트리거돼요.
{% /tab %}
{% tab title="Cluster Alert" %} Cluster alert는 주어진 시간 동안 호스트의 일정 비율이 보고를 중단했는지 추적해요.
클러스터 알림을 설정하려면:
- 태그에 따라 호스트를 그룹화할지 여부를 결정하세요. Ungrouped는 포함된 모든 호스트에 걸쳐 상태 백분율을 계산해요. Grouped는 그룹별로 상태 백분율을 계산해요.
- alert 및 warn 임계값의 백분율을 선택하세요. 하나의 설정(alert 또는 warn)만 필요해요.
- 누락 데이터를 확인할 시간(분)을 입력하세요. 기본값은 2분이에요.
datadog.agent.up이 지정된 시간(분)보다 오래 OK 상태 보고를 중단하고 백분율 임계값에 도달하면 알림이 트리거돼요.
{% /tab %}
고급 알림 조건
고급 알림 옵션(auto resolve, new group delay 등)에 대한 자세한 지침은 Monitor Configuration 페이지를 참고하세요.
알림
Configure notifications and automations 섹션에 대한 자세한 지침은 Notifications 페이지를 참고하세요.
더 알아보기 (Learn more)
추가로 도움이 되는 문서, 링크, 아티클: