본문 바로가기
WIKI 기술 지식 베이스

데이터 큐레이션

원문 보기 위키 갱신

데이터 큐레이션 (Data Curation)

lakeFS Team과 lakeFS Enterprise에서 사용할 수 있어요. 무료 체험을 시작하거나 문의하세요.

출처: 데이터 큐레이션 (Data Curation)

본문

큐레이션된 데이터의 가치

데이터 레이크가 커질수록 그 안의 유용한 데이터를 찾기도, 신뢰하기도 어려워져요. 단일 분석이나 머신러닝 프로젝트가 여러 저장소와 프리픽스에 흩어진 객체와 테이블을 참조하는 경우가 흔하고, 그 데이터를 생산하는 사람과 소비하는 사람은 거의 다른 사람이에요. 소비자는 결국 원하는 데이터가 정확히 어느 저장소, 어느 경로, 어느 커밋에 있는지 알아야 하는데, 그 지식은 플랫폼이 아니라 부족 지식(tribal memory), 위키, 파이프라인 코드에 살고 있어요.

흔한 편법은 프로젝트마다 관련 데이터를 새 위치로 복사하는 거예요. 이것은 중복 스토리지를 만들고, 소스와 동기화가 어긋나고, 데이터가 어디서 왔는지에 대한 계보(lineage)를 잃게 해요. 거버넌스도 손해를 봐요. 접근이 스토리지의 물리적 레이아웃에 묶여 있어서, 큐레이션된 데이터 조각을 공유한다는 것은 소비자가 보면 안 될 데이터까지 포함한 저장소 전체에 접근 권한을 부여하는 일이 되거든요.

lakeFS에서는 데이터를 Datasets이라 불리는 이름 붙고, 버저닝되고, 거버넌스되는 뷰로 큐레이션할 수 있어요. 소비자는 자신에게 필요한 정확히 그 데이터 위의 안정적이고 발견 가능한 계약을 얻고, 기저 데이터는 제자리에 머물러요.

lakeFS Datasets으로 데이터 큐레이션하기

데이터셋은 저장소 데이터 위의 큐레이션된 뷰에 이름을 붙인 일급(first-class) 엔티티예요. 포인터들의 집합과 설명 메타데이터로 이루어져서 데이터는 복사되지 않아요: 데이터셋 정의는 여러분의 소스 저장소 안의 객체, 프리픽스, Iceberg 테이블에 대한 참조를 저장하고, 각각은 특정 커밋에 고정돼 있어요. 이것은 큐레이션을 비용 많은 복사가 아니라 가볍고 반복 가능한 행위로 만들고, 소스 데이터와의 연결도 온전히 유지해요.

발견 가능성 (Discoverability)

데이터셋은 설치 환경의 최상위 수준에서 저장소와 나란히 존재하고, owner, classification, tier 같은 관리자가 정의한 메타데이터를 실고 있어요. 그래서 소비자는 데이터셋이 물리적으로 어느 저장소에 사는지 몰라도, 데이터셋 이름과 그 속성으로 데이터를 찾을 수 있어요. 큐레이션된 customer-360 데이터셋은 생산자만 기억하는 경로가 아니라 조직 전체를 위한 그 데이터의 입구가 돼요.

안정적이고 재현 가능한 계약

모든 데이터셋 버전은 불변이고 단조 증가하는 번호를 가져요. 그래서 customer-360@v7은 이후 기저 저장소가 어떻게 진화하든 항상 같은 객체와 테이블 집합으로 해석돼요. 소비자와 파이프라인은 안정적 계약을 위해 특정 버전에 고정하거나, 현재 큐레이션 상태를 위해 latest를 따를 수 있고, 감사자는 어떤 결정을 뒷받침했던 정확한 버전을 가리킬 수 있어요. 이는 lakeFS 데이터를 재현 가능하게 만드는 것과 동일한 버저닝 위에 직접 구축돼요.

거버넌스된 공유

데이터셋은 그 자체가 접근 경계예요. 큐레이터는 자신이 읽을 수 있도록 허용된 데이터만 연결할 수 있고, 데이터셋을 통해 읽는 소비자는 소스 저장소가 아니라 데이터셋에만 스코프된 권한이 필요해요. 따라서 출처 저장소의 나머지를 노출하지 않고 팀에게 큐레이션된 데이터 조각을 공유할 수 있어요. 공유가 기본으로 거버넌스되고 최소 권한(least-privilege)으로 유지되는 거예요.

요약

lakeFS Datasets으로 데이터를 큐레이션하면, 여러분의 레이크에 이미 존재하는 데이터 위에 이름 붙고 버저닝되고 거버넌스되는 뷰를 발행할 수 있어요. 소비자는 올바른 데이터를 발견하고, 자신 아래에서 바뀌지 않을 것이라 신뢰하며, 자신이 권한을 가진 정확히 그 조각에 접근하게 되죠. 데이터셋은 복사가 아니라 포인터이기 때문에, 스토리지를 복제하거나 계보를 잃지 않고도 이 큐레이션을 얻어요. 데이터셋을 실제로 설정하고 다루는 방법은 Datasets 가이드를 참고하세요. 표준 lakeFS URI와 Iceberg REST Catalog를 통한 데이터셋 어드레싱도 거기서 다뤄요.

더 알아보기 (Learn more)

공식 문서의 원문은 https://docs.lakefs.io/use-cases/data-curation/ 에서 확인할 수 있어요.