장애 복구 전략

장애 복구 전략 (Failure recovery strategies)

노마드에 배포되는 대부분의 애플리케이션은 오래 지속되는 서비스이거나 일회성 배치(batch) 작업이에요. 이들은 다양한 이유로 실패할 수 있어요. 예를 들어:

  • 다시 시작하면 해결되는 서비스의 일시적 오류.
  • 업스트림 의존성이 사용 불가능하여 헬스 체크 실패가 발생하는 경우.
  • 애플리케이션이 실행되는 노드에서 디스크, 메모리, CPU 경합.
  • 애플리케이션이 Docker를 사용하는데 해당 노드의 Docker 데몬이 응답하지 않는 경우.

노마드는 가동 중단을 피하기 위해 실패한 작업을 복구할 수 있는 구성 가능한 옵션을 제공해요. 노마드는 실패한 작업을 실행 중인 노드에서 다시 시작하려 하고, 다른 노드에서 재스케줄링하려고도 해요. 아래 가이드 중 하나로 시작하거나 왼쪽 탐색을 사용해 각 옵션에 대한 자세한 내용을 확인해 주세요:

  • 로컬 재시작 (Local restarts)
  • 헬스 체크 재시작 (Health check restarts)
  • 재스케줄링 (Reschedule)

출처: 문서

본문

노마드는 실패한 작업을 복구해 가동 중단을 방지하기 위한 여러 구성 가능한 메커니즘을 제공해요. 각 옵션에 대한 자세한 내용은 다음 문서를 참고해 주세요:

  • 로컬 재시작 — 실패한 작업을 같은 노드에서 다시 시작해요. 일시적 오류나 서비스 재시작으로 해결되는 문제에 적합해요.
  • 헬스 체크 재시작 — 헬스 체크 실패에 따라 작업을 다시 시작하는 restart 정책을 설정해요.
  • 재스케줄링 — 실패 후 작업을 다른 노드에서 재스케줄링해요. 노드 수준 문제에 적합해요.

더 알아보기 (Learn more)