Kinesis 데이터 스트림 만들고 관리하기

Kinesis 데이터 스트림 만들고 관리하기

Amazon Kinesis Data Streams는 대량의 데이터를 실시간으로 수집하고, 안전하게 보관하며, 소비할 수 있게 해줘요. 여기서 저장되는 단위를 data record라고 하고, data stream은 data record들의 그룹을 나타내요. 스트림 안의 data record는 샤드(shard) 에 분산되죠.

이 섹션에서는 스트림의 capacity mode를 설정하는 법, AWS Management Console이나 API로 스트림을 만드는 법, 그리고 그 뒤에 할 수 있는 추가 작업들을 배워요.

출처: 공식문서

본문

샤드가 데이터 처리량을 만든다

샤드는 스트림 안의 data record 시퀀스로, Kinesis data stream의 기본 처리량 단위(base throughput unit)로 작동해요. 샤드는 on-demandprovisioned 두 capacity 모드 모두에서 쓰기 1 MB/s·1,000 records/s, 읽기 2 MB/s를 지원해요. 이 샤드 한계는 예측 가능한 성능을 보장해서, 안정적인 데이터 스트리밍 워크플로를 설계하고 운영하기 쉽게 만들어 줘요.

이 섹션에서 다루는 주제

  • 스트림 용량 모드 고르기(Choose the right mode to stream in) — on-demand 모드와 provisioned 모드 중 상황에 맞는 쪽을 선택해요.
  • AWS Management Console로 스트림 만들기 — 콘솔 화면에서 몇 번의 클릭으로 스트림을 생성할 수 있어요.
  • API로 스트림 만들기 — SDK/API를 호출해 스트림을 만드는 방법이에요.
  • 스트림 업데이트(Update a stream) — 기존 스트림의 설정을 바꿔요.
  • 스트림 목록(List streams) — 계정의 스트림 목록을 조회해요.
  • 샤드 목록(List shards) — 스트림의 샤드 목록을 확인해요.
  • 스트림 삭제(Delete a stream) — 더 이상 쓰지 않는 스트림을 제거해요.
  • 샤드 재구성(Reshard a stream) — 스트림 용량을 늘리거나 줄이기 위해 샤드를 분할(split)하거나 병합(merge)해요.
  • 데이터 보존 기간 변경(Change the data retention period) — 데이터를 얼마나 오래 보관할지 설정해요.
  • 리소스 태깅(Tag your Kinesis Data Streams resources) — 추적·비용 관리를 위해 태그를 붙여요.
  • 대용량 레코드 처리(Handle large records) — 1 MB에 가까운 큰 레코드를 다룰 때의 고려 사항이에요.
  • Amazon Fault Injection Service로 복원력 테스트 — 장애를 주입해 워크플로의 복원력을 검증해요.

더 알아보기