재해 복구 및 고가용성(Disaster Recovery and High Availability)
재해 복구 및 고가용성(Disaster Recovery and High Availability)
HCP Vault Radar는 재해 복구(DR)와 고가용성(HA)에 대해 공통된 공동 책임 모델(shrared responsibility model)을 따르며, 다중 리전 재해 복구를 통해 데이터와 처리 상태를 리전 간에 복제해요. 이 페이지에서 Vault Radar의 DR/HA 동작을 설명해 드릴게요.
출처: 문서
본문
재해 복구 및 고가용성
HCP Vault Radar는 재해 복구와 고가용성에 대해 일반적인 공동 책임 모델(shared responsibility model)을 따릅니다.
IBM은 Vault Radar 서비스를 사용할 수 있고 장애에 탄력적으로 대응할 수 있도록 보장하는 책임이 있습니다. Vault Radar 플랫폼은 중복 인프라, 장애 조치(failover) 메커니즘, 정기 백업 등 고가용성을 보장하기 위한 다양한 조치를 구현합니다.
Vault Radar 사용자로서, 여러분은 Vault Radar 에이전트, MCP 서버, CLI 등 배포하는 모든 자체 호스팅(self-hosted) Vault Radar 서비스가 자신의 가용성 요구 사항을 충족하도록 구성하는 책임이 있습니다. 여기에는 백업 및 복구 절차 구현, 서비스 상태 모니터링, 서비스가 장애에 탄력적으로 대응하도록 보장하는 것이 포함됩니다.
HCP Vault Radar가 처음이라면 HCP Vault Radar quickstart 튜토리얼 시리즈를 확인해 보세요.
다중 리전 재해 복구 (Multi-region disaster recovery)
Vault Radar 서비스의 다중 리전 재해 복구(DR)는 비밀 탐지 및 수정(remediation) 워크플로에 대한 고가용성과 탄력성을 제공합니다. Vault Radar 플랫폼은 데이터와 지속된 처리 상태(persisted processing state)를 거의 실시간으로 리전 간에 자동 복제하여, 리전 장애 발생 시에도 서비스가 계속 사용 가능하도록 보장합니다.
여기에는 다음이 포함됩니다:
- 검사 결과(Scan results)
- 발견 결과 및 알림(Findings and alerts)
- 수정 컨텍스트(Remediation context)
- 지속된 워크플로 상태(Persisted workflow state)
기본(primary) 리전이 시스템 오브 레코드(system of record) 역할을 하고, 보조(secondary) 리전은 데이터와 시스템 상태 모두의 최신 복제본을 유지합니다. 이로써 리전 장애 중에도 탐지 범위, 발견 결과, 수정 워크플로가 계속 사용 가능하게 됩니다.
다중 리전 재해 복구가 동작하는 방식
Vault Radar는 대기(standby) 상태의 사전 프로비저닝된 보조 리전 배포를 유지하며, 서비스의 일부로 복제와 자동 장애 조치를 관리합니다.
핵심 메커니즘 (Core mechanisms)
- 지속적인 크로스 리전 복제 (Continuous cross-region replication): 데이터가 기본 리전에서 보조 리전으로 지속적으로 복제되어 내구성과 가용성을 보장합니다.
- 지속 상태 복제 (Persisted state replication): Vault Radar는 시스템 처리 상태를 복제하여 장애 조치 후 워크플로가 재개될 수 있게 합니다.
- 기본-보조 아키텍처 (Primary–secondary architecture): 기본 리전이 활성 작업을 처리하고, 보조 리전은 동기화된 상태로 승격 준비가 되어 있습니다.
- 상태 모니터링 (Health monitoring): IBM은 기본 클라우드 제공자 전반의 리전 및 인프라 상태를 모니터링합니다.
- 재해 감지 (Disaster detection): IBM은 클라우드 제공자와 협력하여 인시던트가 일시적인지 아니면 리전 장애인지 평가합니다.
- 장애 조치 오케스트레이션 (Failover orchestration): 재해가 선언되면 IBM은 보조 리전을 활성 상태로 승격합니다.
장애 조치 동작 (Failover behavior)
리전 중단 중에 Vault Radar는 가장 최근에 복제된 데이터와 지속 상태를 사용해 보조 리전을 승격합니다. 장애 조치가 발생하면 Vault Radar는 다음과 같은 동작을 보입니다:
- 데이터 내구성 (Data durability): 검사 결과와 발견 결과를 포함한 복제된 데이터는 장애 조치 후에도 계속 사용 가능합니다.
- 워크플로 연속성 (Workflow continuity): 탐지 및 수정 워크플로가 최소한의 중단으로 계속됩니다.
- 지속 상태에서 재개 (Resumption from persisted state): 워크로드가 복제된 시스템 상태에서 재개됩니다.
- 처리 중 작업 (In-flight processing): 진행 중인 작업은 완전히 보존되지 않을 수 있습니다. 예약된 조정 프로세스(reconciliation processes)가 놓치거나 불완전한 작업을 식별하여 다시 처리합니다.
- 사용자 조치 불필요 (No user action required): 장애 조치 프로세스는 Vault Radar가 완전히 관리합니다. Vault Radar 에이전트, MCP 서버, CLI 같은 자체 호스팅 서비스는 어떤 개입도 필요 없이 계속 작동합니다.
요약
다중 리전 재해 복구는 데이터와 처리 상태를 리전 간에 지속적으로 복제함으로써 HCP Vault Radar의 탄력적인 운영을 가능하게 합니다. 이를 통해 중요한 데이터와 워크플로가 계속 사용 가능하게 유지되고, 사용자의 개입 없이도 리전 장애 중에 빠르게 복구될 수 있습니다.
튜토리얼
튜토리얼을 통해 HCP Vault Radar를 자신의 환경에서 평가하고 구현하는 방법을 배워보세요.
- HCP Vault Radar quickstart – 가상의 커피 회사인 HashiCups가 HCP Vault Radar를 온보딩하고 데이터 소스에서 비밀을 검사하는 과정을 따라 해 봅니다.
- HCP Vault Radar operations – HashiCups 운영 팀이 Vault Radar 에이전트로 데이터 소스를 검사하기 위해 HCP Vault Radar 고급 기능을 어떻게 사용하고, 발견 결과를 HCP Vault와 연관 지어 비밀을 관리하는지 배워봅니다.
- HCP Vault Radar developer – HashiCups 개발자들이 HCP Vault Radar 고급 기능으로 비밀 노출을 이해하고, 잠재적 위험을 식별하며, 소프트웨어 개발 수명 주기 동안 유출된 비밀을 방지하는 방법을 배워봅니다.