프로파일과 데이터 제약조건

프로파일과 데이터 제약조건

whylogs 프로파일은 라이브러리의 핵심이에요. 데이터의 분포, 누락값, 커스텀 메트릭 같은 통계적 속성을 담는 요약 객체로, 세 가지 특성 덕분에 데이터 로깅에 아주 적합해요.

  • Efficient(효율적) — 프로파일이 대표하는 데이터셋을 충실하게 설명하면서도 매우 컴팩트해요. 샘플보다 데이터셋의 특성을 더 잘 포착하는 고충실도 스냅샷이에요.
  • Customizable(커스터마이즈 가능) — 필요에 따라 원하는 메트릭을 추가해서 프로파일을 확장할 수 있어요.
  • Mergeable(병합 가능) — 프로파일끼리 병합해서 더 큰 프로파일을 만들 수 있어요. 분산·스트리밍 시스템에서 로깅하고, 임의의 시간 단위로 집계된 데이터를 볼 수 있게 해주는 핵심 특성이에요.

데이터 제약조건(Constraints)

프로파일은 "지금 데이터가 어떤 상태인가"를 말해주지만, "이 상태가 올바른가"를 판단하려면 기준이 필요해요. 그 기준을 만드는 게 데이터 제약조건이에요.

whylogs로 데이터가 기대한 대로 생겼는지 검증하는 규칙을 만들 수 있어요. 예를 들어 특정 컬럼이 특정 범위 안에 있는지, 고유값 개수가 기대치와 같은지 같은 조건을 정의하고, 데이터가 그 조건을 만족하는지 프로파일을 통해 확인해요. 이 방식은 파이프라인 안에서 데이터 품질을 지속적으로 검증하는 데 쓰여요.

대표적인 활용

이런 프로파일과 제약조건 기능이 모여 다음과 같은 활용을 가능하게 해요.

  • 모델 입력 피처에서 데이터 드리프트 감지
  • 학습-서빙 편향·개념 드리프트·모델 성능 저하 감지
  • 파이프라인의 데이터 품질 검증
  • 대규모 데이터셋 탐색적 분석
  • 조직 전체의 데이터 감사·거버넌스

더 알아보기