HCP Vault Dedicated 로그 및 메트릭 개요
HCP Vault Dedicated 로그 및 메트릭 개요
HCP Vault Dedicated 클러스터를 운영하다 보면 성능과 보안 상태를 어떻게 관찰할지 고민하게 되죠. 감사 로그와 메트릭 옵저버빌리티(observability)는 HCP Vault Dedicated 클러스터의 성능과 보안을 보장하는 데 필수적인데요, 비즈니스 운영(예: 클라이언트 관련 사용량 파악)에도 유용해요. 이 글에서는 HCP Vault Dedicated에서 사용할 수 있는 메트릭의 범위와 의미, 그리고 이상 상태를 탐지하고 대응하는 방법을 전반적으로 설명해 드릴게요.
출처: 문서
본문
HCP Vault Dedicated 메트릭은 다음에 대한 운영 통찰력을 제공해요.
- 클러스터가 기존 및 예상 워크로드를 처리하기에 적절히 프로비저닝되어 있는지 여부
- 클라이언트 접근 패턴과 이상 징후
- 비용을 줄이기 위해 클라이언트 사용 패턴을 최적화할 기회
HCP Vault Dedicated 메트릭에는 Vault telemetry 엔드포인트에서 제공되는 핵심 Vault 성능·사용량 메트릭과 호스트 성능 메트릭이 포함돼요. 노이즈를 줄이기 위해 HCP Vault Dedicated에서 사용할 수 있는 메트릭은 관리형 서비스 맥락에서 사용자에게 실제로 조치 가능한 모범 사례 메트릭으로 범위를 한정해요. 이 문서는 HCP Vault Dedicated 프로덕션 클러스터에서 사용할 수 있는 메트릭을 자세히 설명하고, 이상 상태를 탐지하고 대응하는 방법에 대한 지침을 제공해요.
가용성
감사 로그 및 메트릭 스트리밍은 Development 등급 클러스터에서는 사용할 수 없어요.
HCP Vault Dedicated 감사 로그·메트릭 스트리밍 구성 방법에 대한 자세한 지침은 왼쪽 탐색 메뉴의 특정 프로바이더 문서를 참고해 주세요. 특별한 언급이 없는 한, 모든 HCP Vault Dedicated 샘플 대시보드는 모든 게이지 메트릭을 평균하며 노드별 메트릭은 클러스터 전체에 걸쳐 집계돼요.
연결 고려 사항
메트릭과 감사 로그는 클러스터의 각 Vault 노드에서 직접 스트리밍돼요. peering(AWS 및 Azure) 또는 transit gateway(AWS 전용) 연결을 구성하면, 지원되는 통합(예: 일반 HTTP sink)을 사용해 연결된 네트워크의 프라이빗 주소로 메트릭과 감사 로그를 스트리밍할 수 있어요.
외부 서비스의 경우 스트리밍은 인터넷을 통해 수행돼요.
감사 로그 가용성
감사 로그는 HashiCorp Cloud Platform에서 30일 동안 다운로드할 수 있어요. 서드파티 서비스로 스트리밍할 때 감사 로그 가용성은 대상 서비스의 구성에 따라 달라지지만, HCP에서의 다운로드는 계속 가능해요.
Vault 시스템 메트릭
서드파티 옵저버빌리티 플랫폼의 메트릭 명명 규칙 차이 때문에 통합 대상에 따라 메트릭 이름 형식에 약간의 차이가 있을 수 있어요. 이 문서는 기존 Vault 참조 문서와 일치하도록 Vault telemetry 엔드포인트가 내보내는 메트릭 명명 규칙을 사용할게요.
Sealed 상태 (vault.core.unsealed)
| 메트릭 소스 | 설명 | 단위 | 유형 |
|---|---|---|---|
| Vault | 사용자 또는 시작 과정에서 클러스터 노드가 sealed되었는지 여부를 나타내는 Boolean 메트릭이에요. | bool | gauge |
이 메트릭의 값이 1이면 Vault가 unsealed 상태임을, 0이면 Vault가 sealed 상태임을 나타내요.
왜 중요한가요?
기본적으로 Vault는 시작 시 sealed 상태예요. 따라서 이 값이 예상치 못하게 0으로 바뀌면 Vault가 다시 시작된 것이에요. Vault는 unsealed될 때까지 클라이언트 요청에 응답하지 않아요.
무엇을 봐야 하나요?
HCP Vault Dedicated 샘플 대시보드는 최소 한 개의 노드가 요청을 받아들이고 있으면 "Unsealed"를 표시해요. HashiCorp 운영팀도 백그라운드에서 sealed 상태를 모니터링하며, 클러스터 노드 중 하나 이상이 예기치 않게 sealed 상태로 보고되면 알림을 받아요.
CPU 사용률
이 메트릭은 시스템 레벨 CPU 측정값을 나타내요. HCP Vault Dedicated 샘플 대시보드에서 CPU 사용률은 아래 메트릭들로부터 계산된, CPU 총 시간 비율 대비 CPU 사용량(CPU 시간 비율 - CPU 유휴 시간 비율)의 비율로 계산돼요. 샘플 대시보드에서 모든 비율은 5분 간격으로 계산돼요.
host_cpu_seconds_total
| 메트릭 소스 | 설명 |
|---|---|
| host | 총 CPU 시간을 나타내는 메트릭이에요. |
host_cpu_seconds_total (idle 모드)
| 메트릭 소스 | 설명 |
|---|---|
| host | CPU가 유휴 상태였던 시간을 나타내는 메트릭이에요. |
왜 중요한가요?
암호화는 CPU에 큰 부하를 줄 수 있어요. CPU가 너무 바쁘면 Vault가 들어오는 요청 부하를 따라잡는 데 어려움을 겪을 수 있어요. 용량 계획을 세울 때 CPU 사용률 맥락에서 요청 및 요청 지연 시간 메트릭을 함께 비교하는 것이 유용해요.
메모리 사용률
아래 메트릭은 호스트 메모리 측정값을 나타내요. HCP Vault Dedicated 샘플 대시보드에서 메모리 사용률은 아래 메트릭들로부터 계산된, 메모리 용량 대비 사용 메모리(메모리 용량 - 미사용 메모리)의 비율이에요.
host_memory_total_bytes
| 메트릭 소스 | 설명 |
|---|---|
| host | 서버의 총 물리 메모리(RAM) 용량을 나타내는 메트릭이에요. |
host_memory_available_bytes
| 메트릭 소스 | 설명 |
|---|---|
| host | 서버의 미사용 물리 메모리(RAM) 총량을 나타내는 메트릭이에요. |
왜 중요한가요?
Vault는 작업 데이터 세트를 보관할 충분한 메모리가 필요하며, 사용 가능한 메모리를 모두 소진하면 크래시할 수 있어요.
디스크 사용률
아래 메트릭은 호스트 디스크 측정값을 나타내요. HCP Vault Dedicated 샘플 대시보드에서 디스크 사용률은 아래 메트릭들로부터 계산된, 총 디스크 용량 대비 사용 디스크(디스크 용량 - 미사용 디스크)의 비율이에요.
host_filesystem_total_bytes
| 메트릭 소스 | 설명 |
|---|---|
| host | 디스크 저장 용량을 나타내는 메트릭이에요. |
host_filesystem_free_bytes
| 메트릭 소스 | 설명 |
|---|---|
| host | 미사용 디스크 저장 공간을 나타내는 메트릭이에요. |
왜 중요한가요?
디스크 사용률은 클러스터에 Vault 시크릿을 쓰기에 충분한 용량이 있는지 확인하기 위해 반드시 모니터링해야 해요. 용량 계획을 세울 때 디스크 저장 공간을 Vault 사용량 메트릭과 비교하는 것이 유용해요.
무엇을 봐야 하나요?
디스크 사용률이 80%를 초과하는 경우를 주의 깊게 살펴봐요.
인증 요청 (vault.core.handle_login_request.count)
| 메트릭 소스 | 설명 | 단위 | 유형 |
|---|---|---|---|
| Vault | Vault 코어가 처리한 인증 요청 수를 나타내는 메트릭이에요. | request | gauge |
왜 중요한가요?
이것은 클라이언트 인증 요청과 관련해 Vault가 얼마나 바쁜지 측정하는 핵심 지표예요. 시간에 따라 이 메트릭을 추적하고 호스트 메트릭과 추세를 비교하면 클러스터가 예상 트래픽을 처리하기에 적절히 프로비저닝되어 있는지 이해할 수 있어요. 예상치 못한 급증은 잠재적 보안 위협을 나타낼 수도 있어요.
무엇을 봐야 하나요?
기준 값의 50%를 초과하는 count 또는 mean 필드의 변화, 또는 기준보다 3 표준편차 이상 높은 변화가 있는지 살펴봐요.
만료(expiration) 메트릭
아래 메트릭은 Vault가 제공하는 lease 측정값을 나타내요.
활성 lease (vault.expire.num_leases)
| 메트릭 소스 | 설명 | 단위 | 유형 |
|---|---|---|---|
| Vault | 결국 만료될 자격이 있는 모든 lease의 수를 나타내는 메트릭이에요. | lease | gauge |
왜 중요한가요?
이 메트릭은 lease를 생성하는 모든 인증 메서드와 시크릿 엔진에 걸친 Vault의 대략적인 총 lease 수를 나타내요.
무엇을 봐야 하나요?
count의 크고 예상치 못한 변동은 일괄 작업(bulk operation), 부하 테스트, 또는 통제에서 벗어난 클라이언트 애플리케이션이 과도한 lease를 생성하고 있음을 나타낼 수 있어요. 이런 경우 즉시 조사해야 해요. 지속적으로 높은 count는 클러스터가 과소 프로비저닝되었음을 나타낼 수 있어요.
토큰 폐기 지연 시간 (vault.expire.revoke)
| 메트릭 소스 | 설명 | 단위 | 유형 |
|---|---|---|---|
| Vault | 토큰을 폐기하는 데 걸린 시간을 나타내는 메트릭이에요. | ms | sampled |
왜 중요한가요?
이 값은 토큰의 TTL이 만료되거나 보안 사고 중에 명시적으로 폐기된 후 토큰을 폐기하는 데 걸린 샘플링된 지연 시간을 측정해요. 보안 위험을 줄이려면 지연 시간을 최소화해야 해요.
무엇을 봐야 하나요?
높은 토큰 폐기 지연 시간은 성능 문제를 나타낼 수 있으며, 과소 프로비저닝되거나 건강하지 않은 클러스터에서 비롯될 수 있어요.
토큰 갱신 지연 시간 (vault.expire.renew)
| 메트릭 소스 | 설명 | 단위 | 유형 |
|---|---|---|---|
| Vault | 토큰을 갱신하는 데 걸린 시간을 나타내는 메트릭이에요. | ms | sampled |
왜 중요한가요?
이 값은 유효한 lease 갱신 요청이 이루어진 후 토큰 lease를 갱신하는 데 걸린 샘플링된 지연 시간을 측정해요.
무엇을 봐야 하나요?
높은 토큰 lease 갱신 지연 시간은 성능 문제를 나타낼 수 있으며, 과소 프로비저닝되거나 건강하지 않은 클러스터 때문일 수 있어요.
Vault 사용량 메트릭
다음은 identity, lease, secret, token 사용량을 포함한 일반적인 사용 유형과 관련된 사용량 메트릭이에요. 이 메트릭들은 보안 및 비즈니스 운영 관점에서 Vault 사용 패턴을 이해하는 데 유용해요.
Vault 토큰 사용량 메트릭
왜 중요한가요?
아래 메트릭은 토큰 기반 사용량을 포착해요. 클라이언트 사용 패턴을 이해하고 보안 위협을 나타낼 수 있는 이상 징후를 식별하는 데 유용해요.
메서드 및 TTL별 배치·서비스 토큰 (vault.token.creation)
| 메트릭 소스 | 설명 | 단위 | 유형 |
|---|---|---|---|
| Vault | 새로 생성된 배치(batch) 또는 서비스 토큰의 수를 나타내는 메트릭이에요. | token | counter |
HCP Vault Dedicated 샘플 대시보드에서 이 메트릭은 인증 메서드와 TTL별로 분류돼요.
네임스페이스별 사용 가능 토큰 (vault.token.count)
| 메트릭 소스 | 설명 | 단위 | 유형 |
|---|---|---|---|
| Vault | 사용할 수 있는 서비스 토큰의 수를 나타내는 메트릭이에요. | token | gauge |
네임스페이스·인증 메서드별 사용 가능 토큰 (vault.token.count.by_auth)
| 메트릭 소스 | 설명 | 단위 | 유형 |
|---|---|---|---|
| Vault | 토큰을 만드는 데 사용된 인증 메서드별로 그룹화된 사용 가능 토큰의 수를 나타내는 메트릭이에요. | token | gauge |
네임스페이스·정책별 사용 가능 토큰 (vault.token.count.by_policy)
| 메트릭 소스 | 설명 | 단위 | 유형 |
|---|---|---|---|
| Vault | 할당된 각 정책에서 계산된 사용 가능 토큰의 수를 나타내는 메트릭이에요. | token | gauge |
TTL별 사용 가능 토큰 (vault.token.count.by_ttl)
| 메트릭 소스 | 설명 | 단위 | 유형 |
|---|---|---|---|
| Vault | 생성 시점의 TTL(만료 시간) 설정별로 집계된 기존 토큰의 수를 나타내는 메트릭이에요. | token | gauge |
왜 중요한가요?
더 긴 TTL 설정은 보안 위험을 초래할 수 있으므로, 이 메트릭은 최적이 아닌 관리자 설정을 식별하는 데 유용해요. 예상치 못하게 오래 사는 토큰의 급증은 보안 침해를 나타낼 수도 있어요.
토큰 조회 (vault.token.lookup.count)
| 메트릭 소스 | 설명 | 단위 | 유형 |
|---|---|---|---|
| Vault | 토큰 조회 횟수를 나타내는 메트릭이에요. | lookup | summary |
왜 중요한가요?
이 메트릭은 다른 성능 메트릭과 비교해, 예상되는 토큰 읽기 요청을 처리할 충분한 여유가 있는지 확인하는 데도 유용할 수 있어요.
마운트별 KV 시크릿 (vault.secret.kv.count)
| 메트릭 소스 | 설명 | 단위 | 유형 |
|---|---|---|---|
| Vault | 키-값 저장소의 시크릿 수를 나타내는 메트릭이에요. | secret | gauge |
HCP Vault Dedicated 샘플 대시보드에서 이 메트릭은 마운트별로 표시돼요.
네임스페이스별 Identity 엔티티 (vault.identity.entity.count)
| 메트릭 소스 | 설명 | 단위 | 유형 |
|---|---|---|---|
| Vault | identity 엔티티의 수를 나타내는 메트릭이에요. | entity | gauge |
HCP Vault Dedicated 샘플 대시보드에서 이 메트릭은 네임스페이스별로 그룹화돼요.
메트릭 스트리밍 구성
HCP Vault Dedicated 감사 로그 또는 메트릭 스트리밍을 원하는 프로바이더로 구성하는 방법에 대한 자세한 지침은 다음 문서를 참고해 주세요.
감사 로그 (Audit logs)
- HCP Vault Dedicated 감사 로그 스트리밍을 CloudWatch로 구성하기
- HCP Vault Dedicated 감사 로그 스트리밍을 Datadog으로 구성하기
- HCP Vault Dedicated 감사 로그 스트리밍을 Elasticsearch로 구성하기
- HCP Vault Dedicated 감사 로그 스트리밍을 Grafana Cloud로 구성하기
- HCP Vault Dedicated 감사 로그 스트리밍을 HTTP sink로 구성하기
- HCP Vault Dedicated 감사 로그 스트리밍을 New Relic으로 구성하기
- HCP Vault Dedicated 감사 로그 스트리밍을 Splunk로 구성하기
메트릭 (Metrics)
- HCP Vault Dedicated 메트릭 스트리밍을 CloudWatch로 구성하기
- HCP Vault Dedicated 메트릭 스트리밍을 Datadog으로 구성하기
- HCP Vault Dedicated 메트릭 스트리밍을 Elasticsearch로 구성하기
- HCP Vault Dedicated 메트릭 스트리밍을 Grafana Cloud로 구성하기
- HCP Vault Dedicated 메트릭 스트리밍을 HTTP sink로 구성하기
- HCP Vault Dedicated 메트릭 스트리밍을 New Relic으로 구성하기
- HCP Vault Dedicated 메트릭 스트리밍을 Splunk로 구성하기
참고 자료 (References)
더 알아보기 (Learn more)
- Vault Telemetry 문서 — Vault가 내보내는 원시 메트릭 명명 규칙을 확인할 수 있어요.
- HCP Vault Dedicated 메트릭 스트리밍을 DataDog으로 구성하기 — 대표적인 메트릭 통합 예시를 살펴볼 수 있어요.
- HCP Vault Dedicated 감사 로그 스트리밍을 Splunk로 구성하기 — 감사 로그 스트리밍 구성 예시를 살펴볼 수 있어요.