자동 인스턴스 복구가 발생했는지 확인하기

자동 인스턴스 복구가 발생했는지 확인하기

인스턴스가 오프라인이었다가 예상치 못하게 재부팅된 것처럼 보인다면, 기본 하드웨어나 소프트웨어 문제에 대응해 **자동 인스턴스 복구(automatic instance recovery)**가 진행됐을 수 있어요. Health Dashboard에서 자동 인스턴스 복구 이벤트를 확인하거나, StatusCheckFailed_System Amazon CloudWatch 지표를 확인해 인스턴스의 기본 하드웨어·소프트웨어 문제가 감지됐는지 확인할 수 있습니다.

출처: 문서

본문

Health Dashboard에서 이벤트 확인

자동 인스턴스 복구 시도가 발생하면 AWS가 Health Dashboard에 이벤트를 보내요. 구체적인 이벤트는 구성된 복구 메커니즘과 시도의 성공·실패 여부에 따라 달라집니다.

Health Dashboard에서 자동 인스턴스 복구 이벤트 확인

  1. Health Dashboard(https://phd.aws.amazon.com/phd/home#/)를 엽니다.
  2. 자동 인스턴스 복구와 관련된 이벤트를 찾습니다. 이 이벤트의 존재로 자동 인스턴스 복구 시도가 발생했는지와 그 결과를 확인할 수 있어요.
  • 간소화된 자동 복구(Simplified automatic recovery)
    • 성공 이벤트: AWS_EC2_SIMPLIFIED_AUTO_RECOVERY_SUCCESS
    • 실패 이벤트: AWS_EC2_SIMPLIFIED_AUTO_RECOVERY_FAILURE
  • CloudWatch 작업 기반 복구
    • 성공 이벤트: AWS_EC2_INSTANCE_AUTO_RECOVERY_SUCCESS
    • 실패 이벤트: AWS_EC2_INSTANCE_AUTO_RECOVERY_FAILURE

CloudWatch로 시스템 상태 검사 모니터링

CloudWatch의 StatusCheckFailed_System 지표를 확인해 인스턴스의 기본 하드웨어·소프트웨어 문제가 감지됐는지 검증할 수 있어요. 이 지표 값은 시스템 상태 검사가 통과했는지(하드웨어·소프트웨어 문제 없음) 또는 실패했는지(문제 있음)를 나타냅니다.

기본 하드웨어·소프트웨어 문제가 감지됐는지 확인하기

  1. CloudWatch 콘솔의 Metrics 페이지(https://console.aws.amazon.com/cloudwatch/home?#metricsV2)를 엽니다.
  2. EC2 인스턴스와 같은 리전에 있는지 확인합니다.
  3. Metrics 검색 필드에 다음 지표를 붙여 넣고 Enter를 누릅니다.
StatusCheckFailed_System
  1. EC2 > Per-Instance Metrics를 선택합니다.
  2. 표에서 확인하려는 인스턴스 옆의 체크박스를 선택합니다.
  3. 쿼리 기간을 복구 이벤트가 발생했다고 의심되는 시점으로 변경합니다.
  4. Graphed metrics 탭을 선택하고 StatusCheckFailed_System에 대해 다음을 수행합니다.
    • Statistic에서 Average, Maximum 또는 Minimum 중 하나를 선택합니다.
    • Period에서 1 minute을 선택합니다.
  5. StatusCheckFailed_System 값을 확인합니다.
    • 값 0: 시스템 상태 검사가 통과했으며, 기본 하드웨어·소프트웨어 문제가 없음을 나타냅니다.
    • 값 1: 시스템 상태 검사가 실패했으며, 기본 하드웨어·소프트웨어 문제가 있음을 나타냅니다.

자세한 내용은 "자동 인스턴스 복구"를 참고하세요.

더 알아보기 (Learn more)