장치 상태 (Device Health)
NDM에서 네트워크 장치 문제를 감지하고 이를 구성 변경과 연관 지어 조사하는 Device Health 기능을 안내해요. 장애 장치와 영향받는 메트릭을 식별하고, Bits Investigation으로 근본 원인을 찾고, 구성 롤백까지 진행할 수 있어요.
출처: 문서
본문
Device Health는 미리보기(Preview) 상태예요.
개요
Device Health는 인프라 전반의 네트워크 장치 문제를 표면화하고 구성 변경과 연관 지어 조사하도록 도와줘요. Device Health를 사용해 다음을 할 수 있어요.
- 전체 장치에서 성능이 저하된 장치와 영향받는 메트릭 식별
- 공유 타임라인에서 메트릭 이상을 구성 변경과 연관 지어 파악
- Bits Investigation을 시작해 근본 원인 파악
- 조사 흐름에서 직접 구성 변경을 롤백하는 조치 취하기
전체 장치 문제 보기를 보려면 Infrastructure > Devices > Health로 이동해요. 특정 장치의 활성 문제를 보려면 Devices 목록이나 NDM 시각화에서 장치를 선택해 장치 사이드 패널에서 활성 문제를 열어요.
문제 조사
문제를 선택하면 문제 패널이 열리고 다음을 보여줘요.
- 무슨 일이 있었는지에 대한 일반 언어 요약
- 문제 시작 시점과 심각도를 보여주는 영향받은 메트릭 그래프
- 장치에 구성 변경이 발생한 시점을 보여주는 타임라인 오버레이. 이를 통해 메트릭 이상을 특정 변경과 연관 지을 수 있어요.
Bits Investigation 시작
선택한 문제에서 Bits Investigation을 트리거할 수 있어요. Bits Investigation은 문제를 분석하고 다음을 제공해요.
- 조사와 그 결과에 대한 단계별 요약
- 일반 언어로 된 근본 원인 분석
Bits Investigation을 시작하려면 Investigate further with Bits를 클릭해요. View full investigation을 클릭하면 새 탭에서 전체 조사가 열려요. 자세한 내용은 Bits Investigation을 참고해요.
AI 에이전트(예: Claude Code 또는 Cursor)에서 장치 상태를 조사하려면 Datadog MCP Server의 get_ndm_device 및 search_ndm_interfaces 도구를 사용해요.
제안된 수정 적용
문제 패널에서 직접 제안된 수정(예: 마지막 신뢰 버전으로 구성을 롤백)을 적용해 조치를 취할 수 있어요. 적용될 정확한 구성 변경의 diff를 확인할 수 있어요.
영향받은 장치 및 의존성 보기
문제 패널은 같은 문제에 잠재적으로 영향받는 다른 장치와 의존성도 보여줘요. 이를 통해 네트워크 전반의 영향 범위를 평가할 수 있어요. 더 조사하려면 다이어그램이나 영향받은 장치 목록에서 장치를 선택해 해당 장치 페이지를 열어요.