이용 사례 결정하기
이용 사례 결정하기 (Determine your use case)
조사를 시작하기 전에 이용 사례(use case)를 식별해 올바른 접근 방식과 메트릭 유형을 선택하세요. 이용 사례가 어떤 RED 메트릭으로 시작하고 트레이싱 데이터를 어떻게 탐색할지 결정해요. 무엇이 문제인지 정확히 알고 있을 수도 있고, 문제를 찾기 위해 탐색이 필요할 수도 있죠.
출처: 문서
본문
이 개념이 중요한 이유
이용 사례를 식별하면 조사를 효율적으로 시작하는 데 도움을 줘요. 올바른 RED 메트릭과 워크플로로 안내해 시간을 절약하고 근본 원인을 더 빨리 찾게 해줘요. Grafana Traces Drilldown은 세 가지 주요 조사 유형을 지원해요: 오류 조사, 성능 분석, 활동 모니터링. 각 이용 사례는 다른 시작점과 워크플로를 가져요.
작동 방식
각 이용 사례는 특정 RED 메트릭과 조사 워크플로에 매핑돼요. 조사 목표가 어떤 메트릭으로 시작하고 어떤 탭·뷰가 가장 유용한지 결정해요. 오류 조사는 Errors 메트릭으로 실패 요청과 근본 원인을 찾고, 성능 분석은 Duration 메트릭으로 느린 작업과 지연 병목을 식별하며, 활동 모니터링은 Rate 메트릭으로 서비스 통신 패턴과 요청 흐름을 이해해요.
Traces Drilldown은 선택한 메트릭에 따라 인터페이스를 적응시켜요. Errors를 선택하면 Exceptions, Root cause errors 같은 오류 특화 탭이 보이고, Duration을 선택하면 Root cause latency, Slow traces 같은 지연 중심 탭이 보이며, Rate를 선택하면 Service structure로 서비스 통신을 시각화할 수 있어요.
이용 사례 1: 오류 조사 (Investigate errors)
요청이 실패하고 있거나 오류 알림을 봤을 때 사용해요. Errors 메트릭을 선택하고 Root cause errors 탭이나 Errored traces 탭으로 시작해요.
All spans로 전환할 때: 루트 수준에 나타나지 않는 데이터베이스 오류나 다운스트림 서비스 실패 같은 호출 체인 깊은 곳의 오류를 찾아야 한다면 All spans로 전환하세요.
예시 시나리오: 서비스가 실패하는데 이유를 모를 때, 오류 알림이 있지만 출처를 모를 때, 내부 오류를 찾아야 할 때.
이용 사례 2: 성능 분석 (Analyze performance)
느린 작업, 지연 병목을 식별하거나 응답 시간을 최적화하려고 할 때 사용해요. Duration 메트릭을 선택하고 Root cause latency 탭이나 Slow traces 탭으로 시작해요.
All spans로 전환할 때: 루트 수준에 나타나지 않는 데이터베이스 쿼리나 백그라운드 작업 같은 느린 내부 작업을 찾아야 한다면 All spans로 전환하세요.
예시 시나리오: 사용자가 느린 응답을 보고함, 특정 엔드포인트를 최적화하고 싶음, 느린 데이터베이스 쿼리를 찾아야 함.
이용 사례 3: 활동 모니터링 (Monitor activity)
서비스 통신 패턴, 요청 흐름, 전반적 시스템 활동을 이해하려고 할 때 사용해요. Rate 메트릭을 선택하고 Service structure 탭으로 시작해요.
All spans로 전환할 때: 트레이스 내부의 내부 작업이나 자식 스팬을 봐야 한다면 All spans로 전환하세요. 대부분의 활동 모니터링은 Root spans로 잘 동작해요.
예시 시나리오: 서비스 의존성을 이해하고 싶음, 비정상적인 활동 스파이크를 발견함, 용량 계획을 수행 중.
시작점 선택
- 무엇이 문제인지 안다면: 해당하는 RED 메트릭과 관련 탭으로 직접 시작.
- 탐색 필요: Rate 메트릭이나 Activity 뷰로 시작해 전반적 그림을 파악.
- 능동 분석 수행: Rate와 Service structure로 시스템 동향 파악.
관련 개념/작업
이용 사례를 결정한 뒤에는 RED 메트릭을 선택하고 트레이싱 데이터 분석을 시작하세요.