데이터 레이크하우스란 무엇인가요
데이터 레이크하우스란 무엇인가요
데이터 레이크와 데이터 웨어하우스, 둘 중 하나만 고르라는 건 이제 시대에 안 맞아요. 데이터 레이크는 싸고 유연하지만 신뢰할 만한 보고용 데이터로 쓰기 어렵고, 웨어하우스는 정돈돼 있지만 비싸고 확장이 제한적이죠. 데이터 레이크하우스(lakehouse)는 이 둘의 장점을 합친 데이터 관리 시스템으로, Databricks에서 이 아키텍처를 어떻게 구현하는지 함께 살펴볼게요.
구성과 흐름
데이터 레이크하우스는 ML과 BI처럼 서로 다른 워크로드를 처리하느라 시스템을 따로따로 두는 대신, 하나의 플랫폼에서 모두 처리할 수 있게 해 줘요. 그래서 단일 정보 원천(single source of truth)을 만들고 중복 비용을 없애며, 데이터를 항상 최신 상태로 유지하기 쉬워져요.
"계층을 거치며 데이터를 점진적으로 다듬는다"는 설계 패턴이 자주 등장하는데, 이것이 바로 메달리온 아키텍처(medallion architecture)예요. 데이터가 원시(staging) → 정제 → 제공 단계를 밟으며 가치를 더해가죠.
Databricks는 Apache Spark 위에 만들어져요. Spark 덕분에 저장소와 컴퓨팅을 분리한 채 거대한 스케일로 확장할 수 있고, 두 가지 핵심 기술이 여기에 얹힙니다.
- Delta Lake — ACID 트랜잭션과 스키마 강제를 제공하는 최적화된 저장 계층.
- Unity Catalog — 데이터와 AI를 아우르는 통합적이고 세밀한 거버넌스 솔루션.
계층별 역할
수집(ingestion) 계층에서는 배치든 스트리밍이든 다양한 소스와 포맷의 데이터가 원시 형태로 도착해요. 파일을 Delta 테이블로 바꿀 때 Delta Lake의 스키마 강제 기능으로 누락되거나 예상 밖의 데이터를 잡아낼 수 있고, Unity Catalog로 데이터 거버넌스 모델과 격리 경계에 맞게 테이블을 등록하죠. Unity Catalog는 데이터가 가공되며 변하는 계보(lineage)를 추적하고, 민감 데이터를 안전하게 지키는 통일된 거버넌스를 적용해 줍니다.
정제(cleansing) 계층에서는 검증된 데이터를 다듬고 가공해요. 데이터 과학자와 ML 실무자가 데이터를 결합하거나 새 피처를 만들고 정제 작업을 합니다. 쓰기 시점 스키마(schema-on-write)에 Delta의 스키마 진화(schema evolution)를 더하면, 이 계층을 바꿔도 하위 소비 로직을 반드시 다시 쓸 필요가 없어져요.
제공(serving) 계층은 마지막으로 깨끗하고 풍부해진 데이터를 최종 사용자에게 제공해요. 여기 테이블은 모든 사용 사례를 담당하도록 설계되고, 통일된 거버넌스 덕분에 계보를 단일 정보 원천까지 추적할 수 있죠. 작업별로 최적화된 데이터 배치는 ML 애플리케이션, 데이터 엔지니어링, BI와 리포팅에 모두 쓰입니다.
Databricks 레이크하우스로 할 수 있는 일
- 실시간 데이터 처리 — 스트리밍 데이터를 실시간으로 처리해 즉각 분석·조치합니다.
- 데이터 통합 — 하나의 시스템으로 데이터를 통합해 조직의 협업과 단일 정보 원천을 만듭니다.
- 스키마 진화 — 기존 파이프라인을 흔들지 않고 시간에 따라 스키마를 변경합니다.
- 데이터 변환 — Apache Spark와 Delta Lake로 데이터 변환의 속도·확장성·신뢰성을 확보합니다.
- 분석과 리포팅 — 웨어하우스 워크로드에 최적화된 엔진으로 복잡한 분석 쿼리를 실행합니다.
- 머신러닝과 AI — 모든 데이터에 고급 분석 기법을 적용하고 ML로 데이터를 풍부하게 만듭니다.
- 버전 관리와 계보 — 데이터셋의 버전 이력을 유지하고 계보를 추적해 출처와 추적성을 보장합니다.
요약
데이터 레이크는 싸고 효율적으로 값을 저장·처리하지만 검증이 안 돼 BI 리포트용으로는 잘 안 쓰이고, 웨어하우스는 깨끗한 구조화 데이터를 BI에 제공하죠. 레이크하우스는 둘의 장점을 합쳐 표준 포맷으로 저장된 데이터에 개방·직접 접근하고, ML과 데이터 과학에 최적화된 인덱싱 프로토콜을 쓰며, BI와 고급 분석에 낮은 쿼리 지연과 높은 신뢰성을 제공해요. 최적화된 메타데이터 계층과 클라우드 객체 저장소의 표준 포맷 데이터를 결합하면, 서로 다른 사용 사례에서 같은 데이터와 같은 플랫폼으로 작업할 수 있게 됩니다.
더 알아보기
- 메달리온 레이크하우스 아키텍처 — 계층별 정제 패턴에 대해 더 알아보세요.
- Apache Spark 개요 — Spark 기반 엔진 동작을 이해할 수 있어요.
- What is Delta Lake in Databricks? — 델타 레이크 기초.
- What is Unity Catalog? — 거버넌스 계층 기초.
- 잘 설계된 데이터 레이크하우스 소개 — 구현·운영 원칙과 모범 사례.