Amazon EC2 리소스 모니터링
Amazon EC2 리소스 모니터링
모니터링은 Amazon EC2 인스턴스와 AWS 솔루션의 신뢰성, 가용성, 성능을 유지하는 중요한 부분이에요. AWS 솔루션의 모든 부분에서 모니터링 데이터를 수집해야, 다중 지점 장애(multi-point failure)가 발생했을 때 더 쉽게 디버깅할 수 있어요.
출처: 문서
본문
AWS는 Amazon EC2를 모니터링하는 데 사용할 수 있는 다양한 도구를 제공해요. Amazon EC2와 CloudWatch 콘솔 대시보드는 Amazon EC2 환경의 상태를 한눈에 볼 수 있게 해 줘요. 또한 다음도 제공해요.
-
시스템 상태 검사 (System status checks) – 인스턴스를 사용하는 데 필요한 AWS 시스템을 모니터링해 제대로 작동하는지 확인해요. 이 검사는 수리에 AWS 개입이 필요한 인스턴스 문제를 감지해요. 시스템 상태 검사가 실패하면 AWS가 문제를 해결할 때까지 기다리거나 직접 해결(예: 인스턴스 중지·재시작 또는 종료·교체)할 수 있어요. 시스템 상태 검사가 실패하게 만드는 문제의 예는 다음과 같아요.
- 네트워크 연결 손실
- 시스템 전원 손실
- 물리 호스트의 소프트웨어 문제
- 네트워크 연결성에 영향을 주는 물리 호스트의 하드웨어 문제
자세한 내용은 Amazon EC2 인스턴스의 상태 검사 문서를 참고하세요.
-
인스턴스 상태 검사 (Instance status checks) – 개별 인스턴스의 소프트웨어와 네트워크 구성을 모니터링해요. 이 검사는 수리에 여러분의 개입이 필요한 문제를 감지해요. 인스턴스 상태 검사가 실패하면 보통 직접 문제를 해결해야 해요(예: 인스턴스 재부팅 또는 운영 체제 수정). 인스턴스 상태 검사가 실패하게 만드는 문제의 예는 다음과 같아요.
- 실패한 시스템 상태 검사
- 잘못 구성된 네트워킹 또는 시작 구성
- 메모리 고갈
- 손상된 파일 시스템
- 호환되지 않는 커널
자세한 내용은 Amazon EC2 인스턴스의 상태 검사 문서를 참고하세요.
-
Amazon CloudWatch 알람 – 지정한 기간 동안 단일 지표를 감시하고, 여러 기간에 걸쳐 지표 값이 주어진 임계값과 비교해 그 결과에 따라 하나 이상의 작업을 수행해요. 작업은 Amazon Simple Notification Service(Amazon SNS) 토픽이나 Amazon EC2 Auto Scaling 정책으로 보내지는 알림이에요. 알람은 지속된 상태 변화에 대해서만 작업을 호출해요. CloudWatch 알람은 단순히 특정 상태에 있다는 이유만으로 작업을 호출하지 않아요. 상태가 변하고 지정된 기간 수만큼 유지되어야 해요. 자세한 내용은 CloudWatch로 인스턴스 모니터링하기 문서를 참고하세요.
-
Amazon EventBridge 이벤트 – AWS 서비스를 자동화하고 시스템 이벤트에 자동으로 대응해요. AWS 서비스의 이벤트는 실시간에 가깝게 EventBridge로 전달되며, 이벤트가 여러분이 작성한 규칙과 일치할 때 취할 자동 조치를 지정할 수 있어요. 자세한 내용은 EventBridge로 Amazon EC2 자동화하기 문서를 참고하세요.
-
AWS CloudTrail 로그 – Amazon EC2 API에 대한 호출에 대한 상세 정보를 캡처해 Amazon S3에 로그 파일로 저장해요. CloudTrail 로그를 사용해 어떤 호출이 이루어졌는지, 호출의 소스 IP 주소, 누가 호출했는지, 언제 호출했는지 확인할 수 있어요. 자세한 내용은 AWS CloudTrail로 Amazon EC2 API 호출 로깅 문서를 참고하세요.
-
CloudWatch 에이전트 – EC2 인스턴스와 온프레미스 서버의 호스트·게스트 모두에서 로그와 시스템 수준 지표를 수집해요. 자세한 내용은 Amazon CloudWatch 사용 설명서의 CloudWatch 에이전트로 Amazon EC2 인스턴스와 온프레미스 서버의 지표 및 로그 수집 항목을 참고하세요.
더 알아보기
- 서비스 할당량 (Service quotas)
- 인스턴스 상태 모니터링하기