본문 바로가기
WIKI 기술 지식 베이스

상태 이벤트

원문 보기 위키 갱신

상태 이벤트 (Status Events)

{% alert level="info" %} Status Events는 잠정(provisional) Monitor Status Page의 일부예요. 레거시 상태 페이지를 사용 중이라면 상태 페이지 (레거시) (Status Page (Legacy)) 문서를 참고하세요. {% /alert %}

모니터가 생성하는 모든 이벤트는 모니터의 상태 페이지에 나타나며, 그룹 이름, 이벤트 유형, 타임스탬프를 보여줘요. Event 타임라인에는 다운타임과 감사 추적(audit trail) 이벤트도 포함돼요.

각 이벤트에 대해 빠른 조치(quick actions)에 접근하고 대시보드와 로그 같은 관련 자산을 볼 수 있어요.

출처: 문서

본문

{% image source="https://docs.dd-static.net/images/monitors/status/status_page_event_details.36caee4d912f089eb974978f076d1c77.png?auto=format&fit=max&w=850 1x, https://docs.dd-static.net/images/monitors/status/status_page_event_details.36caee4d912f089eb974978f076d1c77.png?auto=format&fit=max&w=850&dpr=2 2x" alt="Monitor status page displaying event details" /%}

이벤트 세부정보 섹션 (Event details section)

연결된 태그와 조치를 포함해 각 이벤트를 더 자세히 살펴보려면:

  1. 모니터 상태 페이지에서 Event 타임라인으로 스크롤해요.
  2. 타임라인에서 이벤트를 클릭해 이벤트 세부정보를 봐요.

이벤트 세부정보를 사용해 모니터 경보를 이해하고 근본 원인을 파악할 수 있어요. 이 정보는 대응자(responder) 워크플로를 지원하며 진행 중인 상황에 대해 계속 파악하도록 도와줘요.

해결을 위한 조치 취하기 (Take action to remediate)

Quick Actions를 사용하면 상태 페이지를 벗어나지 않고도 조치를 취할 수 있어요. 컨텍스트가 자동으로 추가되므로 대응자가 시간을 절약할 수 있어요.

조치 (Action) 설명 (Description)
Mute 모니터 경보를 음소거할 다운타임 (downtime)을 만들어요.
Resolve 다음 평가까지 모니터 상태를 임시로 OK로 설정해요.
Declare Incident 인시던트 관리 (Incident Management)로 모니터 경보를 에스컬레이션해요.
Create Work Item Datadog를 벗어나지 않고 이 경보 조사를 추적할 작업 항목 (work item)을 만들어요.
Run Workflow 완화 조치를 실행하기 위해 사전 정의된 스니펫으로 Workflow Automation을 실행해요.

해결 (Resolve)

상태 페이지의 Header 또는 Event 세부정보 섹션에서 모니터 경보를 해결할 수 있어요. Event 세부정보 섹션에서 해결하면 선택한 이벤트와 관련된 그룹에만 영향을 주지만, Header에서 해결하면 경보의 모든 그룹을 해결하고 모니터 상태를 OK(모든 그룹)로 설정해요.

모니터의 현재 데이터가 ALERT 상태에 해당해서 모니터가 경보를 발생시키고 있다면, resolve를 사용하면 상태가 ALERT에서 OK로, 그리고 다시 ALERT로 일시적으로 바뀌게 돼요. 따라서 resolve는 경보를 확인(acknowledging)하거나 Datadog에 무시하라고 지시하기 위한 것이 아니에요.

데이터가 간헐적으로 보고될 때 모니터를 수동으로 해결하는 것이 유용해요. 예를 들어, 경보가 트리거된 후 모니터가 데이터 수신을 중단하면 alert 조건을 평가하고 OK 상태로 복구하지 못할 수 있어요. 이런 경우 resolve 함수나 Automatically resolve monitor after X hours이 모니터를 OK 상태로 되돌려요.

일반적인 사용 사례: 오류가 없을 때는 생성되지 않는 오류 메트릭 기반의 모니터(예: aws.elb.httpcode_elb_5xx, 또는 오류가 있을 때만 오류를 보고하는 코드의 DogStatsD 카운터).

이벤트 문제 해결 섹션 (Event troubleshooting section)

{% image source="https://docs.dd-static.net/images/monitors/status/events/event_troubleshooting.8794231e90159cceb3f8f1690ed21946.png?auto=format&fit=max&w=850 1x, https://docs.dd-static.net/images/monitors/status/events/event_troubleshooting.8794231e90159cceb3f8f1690ed21946.png?auto=format&fit=max&w=850&dpr=2 2x" alt="Event troubleshooting with an example dependency map" /%}

각 이벤트에 대해 대응자가 경보의 맥락을 빠르게 이해할 수 있도록 도와주는 문제 해결 정보에 접근할 수 있어요.

문제 해결 구성 요소 (Troubleshooting component) 설명 (Description)
Dependency Map 모니터 태그나 그룹에 서비스 태그가 있으면, 의존성의 상태를 보여주는 의존성 맵(dependency map)에 접근할 수 있어요.
Change Tracking 모니터 태그나 그룹에 서비스 태그가 있으면, 서비스와 그 의존성에 대한 관련 변경 목록에 접근할 수 있어요. 지원되는 변경 유형과 설정 요구사항에 대한 자세한 내용은 변경 추적 (Change Tracking) 문서를 참고하세요.

더 알아보기 (Learn more)