본문 바로가기
WIKI 기술 지식 베이스

네트워크 건강 (Network Health)

원문 보기 위키 갱신

네트워크 문제를 식별하고 실행 가능한 인사이트로 해결하는 방법을 알아봐요. DNS, TLS 인증서, 보안 그룹, 네트워크 이상 전반의 가장 중요한 문제를 자동으로 감지·우선순위화하고 명확한 해결 경로를 제공해요.

출처: 문서

본문

{% alert level="info" %} Network Health는 프리뷰(Preview) 상태예요. 가입하려면 Datadog 담당자에게 문의하세요. {% /alert %}

개요 (Overview)

Network Health는 네트워크에서 가장 중요한 문제에 대한 통합된 뷰를 제공하며, DNS, TLS 인증서, 보안 그룹, 네트워크 이상 전반의 문제를 자동으로 감지하고 우선순위를 정해요. 명확한 해결 경로와 함께 실행 가능한 인사이트를 표시해 연결 문제를 해결하고 인시던트 영향을 줄이도록 도와줘요.

이 페이지는 Network Health 페이지의 섹션과 각 섹션에서 표시되는 문제·인사이트를 설명해요.

{% image source="https://docs.dd-static.net/images/network_performance_monitoring/network_health/network_health_overview.119842bcd48627059197937a88dc23ff.png?auto=format&fit=max&w=850 1x, https://docs.dd-static.net/images/network_performance_monitoring/network_health/network_health_overview.119842bcd48627059197937a88dc23ff.png?auto=format&fit=max&w=850&dpr=2 2x" alt="The Network Health page with the collapsible menu open, highlighting Recommended Actions." /%}

사전 요구 사항 (Prerequisites)

Recommended Actions 섹션은 네트워크에서 감지된 가장 중요한 문제를 강조해요. 이들은 다음을 기준으로 우선순위가 정해져요:

  1. 심각도 (Severity): 문제가 트래픽을 적극적으로 차단하고 있는지 여부
  2. 영향 (Impact): 영향받는 서비스가 인프라에 얼마나 중요한지

각 권장 조치는 다음을 표시해요:

  • 감지된 특정 문제(예: "TLS 인증서 N일 전에 만료됨")
  • 영향받는 클라이언트 서비스(요청을 보내는 서비스)
  • 영향받는 서버 서비스(요청을 받는 서비스)

서비스 이름 위에 마우스를 올리면 APM으로 피벗하거나, Remediate를 클릭해 해결 단계와 함께 새 워크플로 만들기, 케이스 만들기, 인시던트 선언하기 옵션을 볼 수 있어요.

{% image source="https://docs.dd-static.net/images/network_performance_monitoring/network_health/recommended_actions_side_panel.0d8674c29a345bfbeb1c7bb8ceba365a.png?auto=format&fit=max&w=850 1x, https://docs.dd-static.net/images/network_performance_monitoring/network_health/recommended_actions_side_panel.0d8674c29a345bfbeb1c7bb8ceba365a.png?auto=format&fit=max&w=850&dpr=2 2x" alt="Recommended actions side panel of an affected service, showing remediation steps." /%}

Watchdog 인사이트 (Watchdog Insights)

Watchdog Insights 섹션은 Watchdog이 감지한 비정상 네트워크 동작을 표시하며, TCP 재전송의 스파이크에 초점을 맞춰요. 기준선(보통 지난주)과 비교한 재전송 증가는 종종 근본적인 네트워크 문제를 나타내요. 자세한 내용은 Watchdog Insights 문서를 참고하세요.

Watchdog Insights를 사용해:

  • 잠재적 문제를 조기에 감지
  • 이상 현상을 특정 근본 원인과 상관시킴
  • 성능 저하가 사용자에게 영향을 미치기 전에 조사

또한 Datadog MCP Server의 analyze_cloud_network_monitoring 도구를 사용해 Claude Code나 Cursor 같은 AI 에이전트에서 지연 시간, 패킷 손실, TCP 연결 건강 상태를 조사할 수 있어요.

TLS 인증서 (TLS certificates)

만료되었거나 곧 만료될 TLS 인증서는 서비스 간 보안 연결을 차단해 트래픽 손실을 초래할 수 있어요. TLS Certificates 섹션은 다음을 나열해요:

  • 만료된 인증서: 유효하지 않아 트래픽을 차단하는 인증서
  • 곧 만료될 인증서: 만료가 임박한 인증서
  • 영향받는 서비스: 각 인증서 문제의 영향을 받는 클라이언트와 서버 서비스(클라이언트 "서비스"는 Application Load Balancer 같은 AWS 로드 밸런서일 수 있음)

만료된 인증서를 클릭하면 AWS에서 갱신하는 단계를 보거나 새 워크플로 만들기, 케이스 만들기, 인시던트 선언하기를 할 수 있어요.

DNS 실패 (DNS failures)

DNS 잘못된 구성은 트래픽을 잘못된 대상으로 라우팅해 서비스 통신을 차단할 수 있어요. 이러한 실패는 보통 DNS 라우팅 구성의 변경으로 인해 발생해요.

DNS Failures 섹션은 다음을 보여줘요:

  • 실패 사유: DNS 실패의 원인
  • 영향받는 DNS 서버: 높은 실패율을 겪고 있는 DNS 서버
  • 영향받는 서비스: DNS 실패의 영향을 받는 클라이언트와 서버 서비스

실패 사유 (Failure reasons):

{% dl %}

{% dt %} NXDOMAIN {% /dt %}

{% dd %} 도메인 이름이 존재하지 않아요. 보통 구성 오류 또는 제거된 도메인 때문이에요. {% /dd %}

{% dt %} TIMEOUT {% /dt %}

{% dd %} 응답을 받기 전에 DNS 쿼리가 시간 초과됐어요. 네트워크 문제나 응답하지 않는 DNS 서버를 나타낼 수 있어요. {% /dd %}

{% dt %} SERVFAIL {% /dt %}

{% dd %} DNS 서버가 쿼리 처리를 실패했어요. 종종 서버 측 문제 때문이에요. {% /dd %}

{% /dl %}

서비스 이름 위에 마우스를 올리면 APM으로 피벗하거나, 권장 조치를 클릭해 해결 단계와 함께 새 워크플로 만들기, 케이스 만들기, 인시던트 선언하기 옵션을 볼 수 있어요.

보안 그룹 (Security groups)

보안 그룹은 허용·거부 규칙을 통해 클라우드 환경의 트래픽 흐름을 제어해요. 보안 그룹은 기본적으로 트래픽을 거부하기 때문에, 실수로 규칙을 삭제하거나 수정하면 서비스 간 합법적인 트래픽이 즉시 차단될 수 있어요.

참고: 보안 그룹 모니터링은 AWS에서만 사용할 수 있으며, AWS 통합에서 EC2 리소스 수집이 활성화되어 있어야 해요.

Security Groups 섹션은 다음을 식별해요:

  • 트래픽을 차단하는 보안 그룹 잘못된 구성
  • 통신할 수 없는 특정 서비스
  • 보안 그룹 규칙의 최근 변경 사항

해결 방법 (Resolution):

  1. 보안 그룹 문제를 클릭해 사이드 패널을 열어요.
  2. View in AWS를 선택해 AWS 콘솔로 이동해요.
  3. 인바운드 및 아웃바운드 규칙을 검토하고 수정해요.
  4. 사이드 패널의 Infrastructure Change Tracking 데이터를 사용해 변경이 발생한 시점을 파악하고 필요시 되돌려요.

필터링 (Filtering)

페이지 상단의 필터를 사용해 표시되는 문제의 범위를 좁혀요. 사용 가능한 필터는:

  • Service: 특정 서비스에 영향을 주는 문제 보기
  • Team: 특정 팀이 소유한 문제 보기

더 알아보기 (Learn more)

도움이 되는 추가 문서, 링크, 아티클이에요: