데이터 웨어하우징
데이터 웨어하우징 (Data warehousing)
현대 데이터 웨어하우스는 더 이상 저장(storage)과 컴퓨팅(compute)을 긴밀하게 결합하지 않아요. 대신 저장, 거버넌스, 쿼리 처리를 위한 별개의 계층이 서로 연결되어 워크플로에 맞는 도구를 선택할 자유를 줘요. 클라우드 객체 스토리지 위에 오픈 테이블 포맷과 ClickHouse 같은 고성능 쿼리 엔진을 추가하면, 데이터 레이크의 개방성을 희생하지 않으면서 데이터베이스급 기능 — ACID 트랜잭션, 스키마 강제, 빠른 분석 쿼리 — 을 얻을 수 있어요.
출처: 문서
본문
이 조합은 전통적인 분석과 현대 AI/ML 워크로드를 모두 지원하도록, 성능과 상호 운용 가능하고 비용 효율적인 저장을 함께 가져다줘요.
이 아키텍처가 제공하는 것
오픈 객체 스토리지와 테이블 포맷을 ClickHouse를 쿼리 엔진으로 해서 결합하면 다음을 얻을 수 있어요.
| 혜택 | 설명 |
|---|---|
| 일관된 테이블 업데이트 | 테이블 상태에 대한 원자 커밋 덕분에 동시 쓰기가 손상되거나 부분적인 데이터를 만들지 않아요. 이는 원시 데이터 레이크의 가장 큰 문제 중 하나를 해결해요. |
| 스키마 관리 | 강제된 검증과 추적되는 스키마 진화로, 스키마 불일치 때문에 데이터가 쓸모없어지는 "데이터 늪(data swamp)" 문제를 막아줘요. |
| 쿼리 성능 | 인덱싱, 통계, 데이터 스킵핑·클러스터링 같은 데이터 레이아웃 최적화가 SQL 쿼리를 전용 데이터 웨어하우스에 버금가는 속도로 실행하게 해줘요. ClickHouse의 컬럼형 엔진과 결합하면 객체 스토리지에 저장된 데이터에서도 마찬가지예요. |
| 거버넌스 | 카탈로그와 테이블 포맷이 행·열 수준의 세밀한 접근 제어와 감사를 제공해서, 기본 데이터 레이크의 제한된 보안 통제 문제를 해결해요. |
| 저장·컴퓨팅 분리 | 저장과 컴퓨팅이 범용 객체 스토리지 위에서 독립적으로 확장되는데, 이는 독점 웨어하우스 저장보다 훨씬 저렴해요. 분리가 현대 클라우드 웨어하우스의 표준이긴 하지만, 오픈 포맷은 어떤 컴퓨팅 엔진이 데이터와 함께 확장될지 선택할 수 있게 해줘요. |
ClickHouse가 데이터 웨어하우스를 지원하는 방법
데이터는 스트리밍 플랫폼과 기존 웨어하우스에서 객체 스토리지를 거쳐 ClickHouse로 흘러 들어와요. 거기서 변환·최적화되어 BI/AI 도구로 서빙된답니다.
하이브리드 아키텍처: 두 세계의 최선
데이터 레이크를 쿼리하는 것에 더해, 서브초 지연이 필요한 사용 사례 — 실시간 대시보드, 운영 분석, 인터랙티브 애플리케이션 — 를 위해 성능이 중요한 데이터를 ClickHouse 네이티브 MergeTree 저장소에 수집할 수도 있어요. 이렇게 하면 계층형 데이터 전략이 만들어져요. 자주 접근하는 핫(hot) 데이터는 최적화된 저장소에 있어 서브초 쿼리 응답을 제공하고, 전체 데이터 이력을 레이크에 남겨 계속 쿼리 가능하게 해줘요. ClickHouse 매터리얼라이즈드 뷰를 사용해 레이크 데이터를 최적화된 테이블로 지속적으로 변환·집계하고 두 계층을 자동으로 연결할 수도 있어요. 데이터가 어디에 살지는 기술적 제약이 아니라 성능 요구 사항에 따라 결정하면 된답니다.
ClickHouse Academy — 무료 Data Warehousing with ClickHouse 과정을 수강해서 더 자세히 배워보세요.