본문 바로가기
WIKI 기술 지식 베이스

APM 모니터

원문 보기 위키 갱신

APM 모니터 (APM Monitor)

APM 메트릭 모니터는 일반 메트릭 모니터 (metric monitors)처럼 동작하지만, APM에 특화된 제어 기능을 갖춰요. 이 모니터들을 사용해 서비스 수준에서 히트(hits), 오류(errors), 다양한 지연 지표에 대한 경보를 받을 수 있어요.

Analytics 모니터는 시간에 따른 APM 데이터를 시각화하고 Indexed Spans를 기반으로 경보를 설정할 수 있게 해줘요. 예를 들어 Analytics 모니터를 사용해 느린 요청의 급증에 대한 경보를 받을 수 있어요.

출처: 문서

본문

자동 APM 모니터 (Automatic APM monitors)

APM용 자동 모니터는 신규 조직에서 사용할 수 있으며, Datadog Agent가 설치되고 스팬(span)이 Datadog로 흘러 들어오기 시작하는 즉시 활성화돼요. 이는 최소한의 구성으로 주요 서비스에 즉각적인 경보 범위를 제공하고, 공백 없이 범위를 유지하도록 도와줘요.

모니터는 서비스 진입점(service entry points)에 대해 자동으로 생성돼요. 진입점은 span.kind:server 또는 span.kind:consumer로 태그된 작업으로 식별되며, 요청이 서비스로 진입하는 지점을 나타내요.

APM용 자동 모니터에는 다음이 포함돼요:

오류율 임계값 모니터 (Error rate threshold monitors)

오류율 임계값 모니터는 APM 트레이스 메트릭을 사용해 서비스 진입점별로 생성돼요. 오류 동작이 급증할 때 경보를 발생시켜 가장 중요한 엔드포인트가 기본적으로 커버되도록 도와줘요. 기본 오류율은 10%이며 환경에 맞게 구성할 수 있어요.

Watchdog 이상 모니터 (Watchdog anomaly monitors)

Watchdog 이상 모니터는 모든 서비스의 지연, 오류, 요청 볼륨(히트)에서 비정상적인 패턴을 자동으로 감지해요. 임계값을 수동으로 구성할 필요가 없어요.

참고: 자동 모니터 생성은 평가판(trial) 기간에만 사용할 수 있어요.

자동으로 생성된 모든 모니터는 Monitors 페이지에서 보고 관리할 수 있어요. 편집, 복제, 또는 비활성화할 수 있어요.

모니터 생성 (Monitor creation)

Datadog에서 APM 모니터를 만들려면 기본 내비게이션 Monitors > New Monitor > APM를 사용해요.

APM Metrics 또는 Trace Analytics 모니터 중에서 선택하세요:

{% tab title="APM Metrics" %}

모니터 범위 선택 (Select monitor scope)

드롭다운 메뉴에서 기본 태그 (primary tags), 서비스 (service), 리소스 (resource)를 선택해요.

경보 조건 설정 (Set alert conditions)

Threshold 또는 Anomaly 경보를 선택해요:

Threshold 경보 (Threshold alert)

메트릭이 임계값을 교차할 때마다 경보가 트리거돼요.

  • Requests per second, Errors per second, Apdex, Error rate, Avg latency, p50 latency, p75 latency, p90 latency, 또는 p99 latency에 대해 경보
  • is above, above or equal to, below, 또는 below or equal to
  • Alert threshold <NUMBER>
  • Warning threshold <NUMBER>
  • 지난 5분, 15분, 1시간 등, 또는 커스텀으로 1분에서 48시간 사이의 값을 설정
Anomaly 경보 (Anomaly alert)

메트릭이 예상 패턴에서 벗어날 때마다 경보가 트리거돼요.

  • Requests per second, Errors per second, Apdex, Error rate, Avg latency, p50 latency, p75 latency, p90 latency, 또는 p99 latency에 대해
  • <ALERT_THRESHOLD>%, <WARNING_THRESHOLD>%의 값이
  • <NUMBER> 표준편차만큼 위/아래, 위, 또는 아래
  • 지난 5분, 15분, 1시간 등의 예측에서, 또는 커스텀으로 1분에서 48시간 사이의 값을 설정
고급 경보 조건 (Advanced alert conditions)

고급 경보 옵션(no data, evaluation delay 등)에 대한 자세한 지침은 모니터 구성 (Monitor configuration) 페이지를 참고하세요. 메트릭별 옵션인 full data window는 메트릭 모니터 (Metric monitor) 페이지를 참고하세요. {% /tab %}

{% tab title="Trace Analytics" %}

{% alert level="info" %} 계정당 Trace Analytics 모니터의 기본 한도는 1000개예요. 이 한도에 도달했다면 멀티 알림 (multi alerts) 사용을 고려하거나 지원팀에 문의 (Contact Support)하세요. {% /alert %}

검색 쿼리 정의 (Define the search query)

  1. 트레이스 검색 (trace search)과 같은 로직으로 검색 쿼리를 구성해요.
  2. 트레이스 수(trace count), facet, 또는 measure 중 무엇을 모니터링할지 선택해요:
    • 트레이스 수 모니터링: 검색 바를 사용하고(선택 사항) facet이나 measure를 선택하지 않아요. Datadog는 선택한 시간대에 걸친 트레이스 수를 평가한 다음 이를 임계값 조건과 비교해요.
    • facet 또는 measure 모니터링: facet을 선택하면 모니터는 facet의 고유 값 수(Unique value count)에 대해 경보를 발생시켜요. measure를 선택하면 메트릭 모니터와 유사하며 집계(min, avg, sum, median, pc75, pc90, pc95, pc98, pc99, max)를 선택해야 해요.
  3. 여러 차원으로 트레이스를 그룹화해요(선택 사항): 쿼리와 일치하는 모든 트레이스는 최대 4개 facet의 값을 기준으로 그룹으로 집계돼요.
  4. 경보 그룹화 전략을 구성해요(선택 사항):
    • Simple alert: 단순 경보는 모든 보고 소스에 대해 집계해요. 집계된 값이 설정된 조건을 충족하면 하나의 경보를 받아요. 쿼리에 group by가 있고 simple alert 모드를 선택하면, 하나 이상의 그룹 값이 임계값을 위반할 때 하나의 경보를 받아요. 이 전략은 알림 노이즈를 줄이기 위해 선택할 수 있어요.
    • Multi alert: 멀티 경보는 그룹 매개변수에 따라 각 소스에 경보를 적용해요. 설정된 조건을 충족하는 각 그룹에 대해 경보 이벤트가 생성돼요. 예를 들어 쿼리를 @resource.name으로 그룹화하면 스팬의 오류율이 높을 때 각 리소스에 대해 별도의 경보를 받을 수 있어요.

{% image source="https://docs.dd-static.net/images/monitors/monitor_types/apm/define-the-search-query.9f8ef2e34cf869763d95ebea97270764.png?auto=format&fit=max&w=850 1x, https://docs.dd-static.net/images/monitors/monitor_types/apm/define-the-search-query.9f8ef2e34cf869763d95ebea97270764.png?auto=format&fit=max&w=850&dpr=2 2x" alt="Define the search query" /%}

참고: Analytics 모니터는 커스텀 보존 필터 (custom retention filters)가 보존한 스팬만 평가해요(intelligent retention filter는 아님). 또한 트레이스 수준 보존 필터 (trace-level retention filters)에 의해 간접적으로 인덱싱된 스팬(즉, 쿼리와 직접 일치하지 않지만 일치하는 트레이스에 속하는 스팬)은 트레이스 분석 모니터에서 평가되지 않아요.

경보 조건 선택 (Select alert conditions)

  • 쿼리 결과가 above, above or equal to, below, 또는 below or equal to일 때 트리거
  • 지난 5분, 15분, 1시간, 또는 커스텀으로 5분에서 48시간 사이의 값을 설정하는 동안의 임계값.
  • Alert threshold: <NUMBER>
  • Warning threshold: <NUMBER>
No data 및 below 경보 (No data and below alerts)

특정 쿼리와 일치하는 그룹이 스팬 전송을 중단할 때 알림을 받으려면 조건을 1 미만(below 1)으로 설정해요. 이는 정의된 평가 기간 동안 그룹에 대해 모니터 쿼리와 일치하는 스팬이 없을 때 알려줘요.

고급 경보 조건 (Advanced alert conditions)

고급 경보 옵션(evaluation delay 등)에 대한 자세한 지침은 모니터 구성 (Monitor configuration) 페이지를 참고하세요. {% /tab %}

알림 (Notifications)

Configure notifications and automations 섹션에 대한 자세한 지침은 알림 (Notifications) 페이지를 참고하세요.

참고: 서비스 수준 모니터는 Catalog와 Service Map에서 찾을 수 있고, 리소스 수준 모니터는 개별 리소스 페이지에서 찾을 수 있어요(서비스 세부정보 페이지에 나열된 특정 리소스를 클릭하면 갈 수 있어요).

더 알아보기 (Learn more)