Observability dashboard로 클러스터 모니터링하기

Observability dashboard로 클러스터 모니터링하기

Amazon EKS 콘솔에는 클러스터 성능에 대한 가시성을 제공하는 observability dashboard가 포함되어 있어요. 이 정보는 문제를 빠르게 감지·해결·복구하는 데 도움을 줘요. Health and performance summary에서 항목을 선택해 observability dashboard의 해당 섹션을 열 수 있어요. 이 요약은 Observability 탭을 포함한 여러 곳에 표시돼요.

observability dashboard는 여러 탭으로 나뉘어 있어요.

출처: 문서

본문

Summary

Health and performance summary는 다양한 범주의 항목 수를 나열해요. 각 숫자는 해당 범주의 목록이 있는 observability dashboard 위치로 연결되는 하이퍼링크 역할을 해요.

Cluster health

Cluster health는 가능한 한 빨리 조치해야 할 수도 있는 중요한 알림을 제공해요. 이 목록으로 설명과 영향을 받는 리소스를 볼 수 있어요. Cluster health는 Health issues와 Configuration insights 두 개의 테이블을 포함해요. Health issues의 상태를 새로고침하려면 새로고침 버튼(↻)을 선택하세요. Configuration insights는 24시간마다 한 번 자동으로 업데이트되며 수동으로 새로고침할 수 없어요.

Health issues에 대한 자세한 내용은 Cluster health FAQs and error codes with resolution paths를 참고하세요. Configuration insights에 대한 자세한 내용은 cluster insights로 Kubernetes 버전 업그레이드 준비 및 잘못된 구성 문제 해결을 참고하세요.

Control plane monitoring

Control plane monitoring 탭은 세 개의 섹션으로 나뉘며, 각 섹션은 클러스터의 컨트롤 플레인을 모니터링하고 문제를 해결하는 데 도움을 줘요.

Metrics

Kubernetes 1.28 이상 버전의 클러스터에서 Metrics 섹션은 다양한 컨트롤 플레인 구성 요소에 대해 수집된 여러 지표의 그래프를 보여줘요.

섹션 위쪽에서 선택하여 모든 그래프 X축의 시간 기간을 설정할 수 있어요. 새로고침 버튼(↻)으로 데이터를 새로고침할 수 있어요. 각 개별 그래프에서 세로 줄임표 버튼(⋮)은 CloudWatch의 옵션이 있는 메뉴를 열어요.

이 지표들과 더 많은 지표는 CloudWatch의 AWS/EKS 네임스페이스 아래에서 기본 모니터링 지표로 자동 제공돼요. 자세한 내용은 Amazon CloudWatch 사용자 가이드의 Basic monitoring and detailed monitoring을 참고하세요. 더 상세한 지표, 시각화, 인사이트를 원한다면 Amazon CloudWatch 사용자 가이드의 Container Insights를 참고하세요. Prometheus 기반 모니터링을 선호한다면 Prometheus로 클러스터 지표 모니터링하기를 참고하세요.

다음 표는 사용 가능한 지표를 설명해요.

지표 설명
APIServer Requests API 서버에 대한 분당 요청 수
APIServer Total Requests 4XX HTTP 4XX 응답 코드(클라이언트 측 오류)를 가진 분당 API 서버 요청 수
APIServer Total Requests 5XX HTTP 5XX 응답 코드(서버 측 오류)를 가진 분당 API 서버 요청 수
APIServer Total Requests 429 HTTP 429 응답 코드(요청 과다)를 가진 분당 API 서버 요청 수
Storage size 스토리지 데이터베이스(etcd) 크기
Scheduler attempts "unschedulable", "error", "scheduled" 결과별로 Pod를 스케줄하려는 시도 수
Pending pods "active", "backoff", "unschedulable", "gated" 큐 유형별 대기 중인 Pod 수
API server request latency API 서버 요청의 지연 시간
API server current inflight requests API 서버의 현재 처리 중(in-flight) 요청 수
Webhook requests 분당 웹훅 요청 수
Webhook request rejections 거부된 웹훅 요청 수
Webhook request latency P99 외부 제3자 웹훅 요청의 99번째 백분위수 지연 시간

CloudWatch Log Insights

CloudWatch Log Insights 섹션은 컨트롤 플레인 감사 로그를 기반으로 한 다양한 목록을 보여줘요. 이 기능을 사용하려면 Amazon EKS 컨트롤 플레인 로그를 켜야 하며, View control plane logs in CloudWatch 섹션에서 할 수 있어요.

데이터를 수집할 시간이 충분히 지나면 Run all queries를 실행하거나 한 번에 하나의 목록에 대해 Run query를 선택할 수 있어요. 쿼리를 실행할 때마다 CloudWatch에서 추가 요금이 발생해요. 섹션 위쪽에서 보고 싶은 결과의 시간 기간을 선택하세요. 어떤 쿼리에 대해 더 고급 제어를 원한다면 View in CloudWatch를 선택할 수 있어요. 그러면 CloudWatch에서 쿼리를 업데이트해 필요에 맞출 수 있어요.

자세한 내용은 Amazon CloudWatch Logs 사용자 가이드의 Analyzing log data with CloudWatch Logs Insights를 참고하세요.

View control plane logs in CloudWatch

Manage logging을 선택해 사용 가능한 로그 유형을 업데이트하세요. 로깅을 활성화한 뒤 CloudWatch Logs에 로그가 나타나려면 몇 분이 걸려요. 시간이 충분히 지나면 이 섹션의 View 링크 중 하나를 선택해 해당 로그로 이동하세요.

자세한 내용은 컨트롤 플레인 로그를 CloudWatch Logs로 보내기를 참고하세요.

Cluster insights

Upgrade insights 테이블은 문제를 표면화하고 시정 조치를 권장하여 새 Kubernetes 버전으로의 업그레이드 검증 과정을 가속화해요. Amazon EKS는 잠재적인 Kubernetes 버전 업그레이드 영향 문제 목록에 대해 클러스터를 자동으로 스캔해요. Upgrade insights 테이블은 Amazon EKS가 이 클러스터에 대해 수행한 insight 검사와 관련 상태를 나열해요.

Amazon EKS는 Kubernetes 프로젝트의 변경 사항과 새 버전과 관련된 Amazon EKS 서비스 변경 사항에 대한 평가를 기반으로 수행할 insight 검사 목록을 유지하고 주기적으로 새로고침해요. Amazon EKS 콘솔은 각 insight의 상태를 자동으로 새로고침하며, 이는 last refresh time 열에서 볼 수 있어요.

자세한 내용은 cluster insights로 Kubernetes 버전 업그레이드 준비 및 잘못된 구성 문제 해결을 참고하세요.

Node health issues

Amazon EKS 노드 모니터링 에이전트(node monitoring agent)는 노드 로그를 자동으로 읽어 상태 문제를 감지해요. auto repair 설정과 무관하게 모든 노드 상태 문제가 보고되므로 필요에 따라 조사할 수 있어요. 설명 없이 나열된 문제 유형이 있다면 해당 문제의 popover 요소에서 설명을 읽을 수 있어요.

페이지를 새로고침하면 해결된 문제는 목록에서 사라져요. auto repair가 활성화되어 있으면 여러분의 조치 없이 해결될 일부 상태 문제가 일시적으로 보일 수 있어요. auto repair가 지원하지 않는 문제는 유형에 따라 수동 조치가 필요할 수 있어요.

노드 상태 문제가 보고되려면 클러스터가 Amazon EKS Auto Mode를 사용하거나 node monitoring agent 애드온이 있어야 해요. 자세한 내용은 노드 상태 문제 감지 및 자동 노드 복구 활성화를 참고하세요.

EKS Capabilities

Capabilities 섹션은 클러스터의 EKS Capability 리소스 상태와 건강을 보여줘요. capability와 클러스터의 관리형 Kubernetes 리소스 모두에 대한 상태 및 건강 알림을 여기서 모니터링할 수 있어요. 페이지를 새로고침하면 해결된 문제는 목록에서 사라져요.

자세한 내용은 capability 리소스 작업하기를 참고하세요.

더 알아보기 (Learn more)