스트리밍 수집
스트리밍 수집 (Streaming ingestion)
Apache Druid는 Apache Kafka와 Amazon Kinesis 같은 외부 스트리밍 소스에서 데이터 스트림을 소비할 수 있어요. 이 두 indexing service는 정확히 한 번(Exactly-once) 스트림 처리 보장을 갖춘 실시간 데이터 수집을 제공하며, supervisor가 수집 태스크를 지속적으로 감독·관리합니다.
출처: 문서
본문
Apache Druid는 다음과 같은 외부 스트리밍 소스에서 데이터 스트림을 소비할 수 있어요.
- 번들로 제공되는 Kafka indexing service 확장을 통한 Apache Kafka
- 번들로 제공되는 Kinesis indexing service 확장을 통한 Amazon Kinesis
두 indexing service 모두 정확히 한 번(Exactly-once) 스트림 처리 보장을 갖춘 실시간 데이터 수집을 제공해요. 스트리밍 수집 방법을 사용하려면 먼저 Overlord와 Middle Manager 양쪽에 관련 확장을 로드해야 합니다. 자세한 내용은 Loading extensions를 참고하세요.
스트리밍 수집은 계속 실행되는 supervisor가 제어해요. supervisor는 indexing task의 상태를 감독하면서 hand-off를 조정하고, 실패를 관리하며, 확장성과 복제 요구사항이 유지되도록 보장합니다. supervisor는 Druid 웹 콘솔이나 Supervisor API를 통해, 흔히 supervisor spec이라 부르는 JSON 명세를 제출해서 시작합니다.
더 알아보기 (Learn more)
- Kafka 수집 가이드 — Kafka 스트리밍 수집 설정 방법
- Kinesis 수집 가이드 — Kinesis 스트리밍 수집 설정 방법
- Supervisor 문서 — supervisor 스펙과 동작 방식