통합 데이터 관리
통합 데이터 관리 (Unified Data Management)
lakeFS Team과 lakeFS Enterprise에서 사용할 수 있어요. 무료 체험을 시작하거나 문의하세요.
본문
모든 데이터를 위한 단일 플랫폼
데이터 플랫폼이 단일 종류의 데이터나 단일 보관 장소만 다루는 경우는 드물어요. 전형적인 조직은 이미지, 문서, 모델 아티팩트 같은 비구조화 파일 옆에 구조화 테이블을 두고, 이를 둘 이상의 스토리지 시스템에, 종종 둘 이상의 클라우드에 흩어두고 있죠. 이 각각을 자체 카탈로그, 자체 권한 모델, 자체 접근 경로로 관리하면 파편화된 거버넌스, 중복된 노력, 일관성을 잃지 않고는 옮기기 어려운 데이터로 이어져요.
lakeFS Enterprise는 그 모든 데이터를 하나의 버저닝된 시스템으로 관리하게 해줘요. 구조화 데이터와 비구조화 데이터를 함께 보관하는 단일 장소, 스토리지 백엔드와 클라우드에 걸치는 하나의 접근 제어 모델, 그리고 현대 컴퓨트가 실제로 데이터를 소비하는 방식에 맞춰 조율된 데이터 접근 경로를 얻게 되죠. 이 페이지의 나머지는 이것을 가능하게 하는 세 기둥을 다뤄요.
단일 저장소의 멀티모달 데이터
lakeFS 저장소는 포맷에 구애받지 않아서(format-agnostic), 구조화 데이터와 비구조화 데이터가 같은 버저닝 엔진 아래 나란히 살아요. 내장 Iceberg REST Catalog를 통해 Apache Iceberg 테이블을 관리하면서 같은 저장소에 이미지, 오디오, 문서 같은 비구조화 객체도 유지할 수 있고, 단일 커밋이 양쪽에 걸친 일관된 스냅샷을 캡처할 수 있어요. 즉, 모델을 구동하는 테이블 형태의 피처와 그 피처가 파생된 원본 파일이 서로 단절된 두 시스템이 아니라 함께 버저닝돼요.
두 종류의 데이터가 저장소를 공유하기 때문에, Metadata Search가 하나의 인터페이스에서 그들 사이를 쿼리할 수 있어요. 경로와 크기 같은 시스템 메타데이터나 여러분의 사용자 정의 메타데이터로 객체를 필터링할 수 있어요. 이는 레이블과 파일 속성으로 학습 데이터를 선택하고, 그 선택을 그것을 설명하는 구조화 테이블과 조인해야 하는 머신러닝 워크플로에 특히 유용해요. 하나의 저장소에서 구조화·비구조화 데이터를 관리하고 하나의 검색으로 쿼리하는 것은, 보통 팀이 별도의 카탈로그를 잇게 만드는 경계를 없애요.
백엔드와 클라우드에 걸친 통합 접근 제어
데이터가 여러 스토리지 시스템에 걸칠 때 권한 일관성을 유지하는 것이 보통 가장 어려운 부분이에요. lakeFS Enterprise는 그것이 관리하는 모든 데이터 위에 하나의 Role-Based Access Control 모델을 적용해요. 그래서 기저 바이트가 물리적으로 어디에 살든 단일 정책 집합이 접근을 거버넌스해요. 누가 어떤 리소스를 읽고 쓸 수 있는지를 한 번 정의하면, 그 결정이 설치 환경 전체에서 유지돼요.
온프레미스, 하이브리드, 멀티클라우드 환경에 걸친 데이터를 여러 스토리지 백엔드로 관리할 때 이것이 가장 중요해요. 클라우드와 버킷마다 별도의 IAM 시스템을 조율하는 대신, 모든 것을 lakeFS를 통해 거버넌스해요. 그러면 데이터 자체는 인프라와 비용 모델에 맞는 위치에 분산된 채로 두면서, 데이터 보안과 컴플라이언스를 강제하는 단일 장소를 얻게 돼요.
최적화된 데이터 접근과 검색
한 곳에서 데이터를 관리하는 것은 컴퓨트가 그것에 효율적으로 도달할 수 있을 때만 유용해요. lakeFS Mount는 이 경로를 최적화해요. 저장소를 로컬 파일시스템처럼 가상으로 마운트하고 데이터를 느긋하게(lazily) 가져와서, GPU 학습 잡 같은 비싼 컴퓨트가 대량 데이터를 lakeFS 서버로 라우팅하지 않고 presigned URL을 통해 기저 오브젝트 스토어에서 직접 파일을 읽어요. 이것은 값비싼 가속기를 I/O를 기다리며 놀게 두지 않고 바쁘게 유지하면서, 여러분의 코드는 평범한 파일시스템 호출을 계속 사용하게 해줘요.
리전이나 환경 사이에 데이터를 배포하기 위해서는, transactional mirroring이 저장소를 원격 위치의 일관된 읽기 전용 복제본으로 복제해요. 복제본은 부분 변경의 스트림이 아니라 커밋된 일관된 상태를 반영하기 때문에, 다른 리전의 소비자는 진행 중인 뷰가 아니라 응집된 데이터 뷰를 읽어요. Mount와 미러링이 함께 신뢰할 수 있게 만드는 일관성 보장을 포기하지 않으면서, 필요한 컴퓨트 근처에 데이터를 두게 해줘요.
요약
lakeFS Enterprise의 통합 데이터 관리란, 구조화·비구조화 데이터를 함께 관리하고 하나의 인터페이스로 검색하는 것, 모든 스토리지 백엔드와 클라우드에 걸치는 하나의 접근 제어 모델, 그리고 현대 컴퓨트의 요구를 위해 설계된 데이터 접근 경로를 의미해요. 데이터 종류와 위치마다 별도의 카탈로그, 권한 시스템, 전달 메커니즘을 운영하는 대신, 모든 것을 하나의 버저닝되고 거버넌스된 플랫폼으로 관리해요. 구성 요소를 더 깊이 알고 싶다면 Iceberg REST Catalog, Metadata Search, RBAC, multiple storage backends, lakeFS Mount, transactional mirroring을 참고하세요.
더 알아보기 (Learn more)
공식 문서의 원문은 https://docs.lakefs.io/use-cases/unified-data-management/ 에서 확인할 수 있어요.