통합 (Spark·Kafka·WhyLabs)

통합 (Spark·Kafka·WhyLabs)

whylogs는 단순한 파이썬 라이브러리를 넘어 다양한 환경과 연동돼요. 구조화·비구조화 데이터, ML 모델 예측까지 실시간으로 프로파일링하는 경량 에이전트 역할을 할 수 있어요.

파이썬·자바·스파크 환경 어디서든 설치할 수 있고, 컨테이너로 배포해 사이드카(sidecar)로 돌릴 수도 있어요. 여러 ML 도구와도 연동돼요.

주요 통합

통합 설명 형태
Spark Apache Spark 환경에서 whylogs 실행 코드 예제
Pandas 모든 판다스 데이터프레임 로깅·모니터링 노트북 예제
Kafka Kafka 토픽을 whylogs로 로깅·모니터링 노트북 예제

빠른 데이터 로깅 예제

통합 환경에서 데이터를 로깅하는 기본 패턴은 이렇게 생겼어요.

#dataframe
logger.log_dataframe(df)

#dict
logger.log({"name": 1})

#images
logger.log_images("path/to/image.png")

whylogs는 구조화·비구조화 데이터를 모두 지원하고, 컬럼 단위로 데이터의 근사 통계와 스케치(sketch)를 수집해 통계 프로파일로 만든다.

WhyLabs 연동

WhyLabs는 whylogs 프로파일을 최대한 활용할 수 있게 만든 관리형 서비스예요. WhyLabs에 프로파일을 올리면 자동 모니터링을 설정하고, 데이터·ML 시스템 전체에 대한 관측성을 얻을 수 있어요.

플랫폼에서 접속 자격 증명을 얻은 뒤 파이썬 환경에 설정하고, 데이터를 로깅한 다음 WhyLabs에 기록하면 돼요. 이렇게 하면 프로파일 기반의 지속 모니터링과 문제 디버깅이 가능해져요.

더 알아보기