Databricks (데이터 플랫폼)
Databricks (데이터 플랫폼)
Databricks는 데이터 레이크와 데이터 웨어하우스의 장점을 하나로 합친 데이터 레이크하우스(lakehouse) 아키텍처 위에서, 데이터 엔지니어링부터 머신러닝·BI까지 한 플랫폼에서 처리하게 해 주는 통합 데이터 플랫폼이에요. Apache Spark 기반의 확장 가능한 컴퓨팅을 제공하고, 저장소와 컴퓨팅을 분리해 필요할 때만 컴퓨팅을 올리는 방식으로 운영 비용을 아낄 수 있죠.
이 허브 아래에는 Databricks가 내세우는 핵심 기술인 데이터 레이크하우스 아키텍처, Delta Lake, 노트북, 워크플로(작업), Unity Catalog 관점의 가이드를 정리해요.
핵심 기술
- 데이터 레이크하우스 — 데이터 레이크의 개방성·저비용과 데이터 웨어하우스의 신뢰성·성능을 합친 저장 아키텍처.
- Delta Lake — ACID 트랜잭션과 스키마 강제를 제공하는 최적화된 저장 계층. Databricks의 모든 테이블 기본 포맷.
- 노트북(Notebook) — 데이터 과학·ML 워크플로를 만드는 기본 도구. 다중 언어 실시간 협업과 자동 버전 관리 지원.
- Lakeflow Jobs — 데이터 처리 워크로드를 예약·조율하는 워크플로 자동화. 태스크·트리거·DAG 기반.
- Unity Catalog — 데이터와 AI 자산에 대한 통합된 세밀한 거버넌스 계층.