통합 (Spark·Kafka·WhyLabs)
통합 (Spark·Kafka·WhyLabs)
whylogs는 단순한 파이썬 라이브러리를 넘어 다양한 환경과 연동돼요. 구조화·비구조화 데이터, ML 모델 예측까지 실시간으로 프로파일링하는 경량 에이전트 역할을 할 수 있어요.
파이썬·자바·스파크 환경 어디서든 설치할 수 있고, 컨테이너로 배포해 사이드카(sidecar)로 돌릴 수도 있어요. 여러 ML 도구와도 연동돼요.
주요 통합
| 통합 | 설명 | 형태 |
|---|---|---|
| Spark | Apache Spark 환경에서 whylogs 실행 | 코드 예제 |
| Pandas | 모든 판다스 데이터프레임 로깅·모니터링 | 노트북 예제 |
| Kafka | Kafka 토픽을 whylogs로 로깅·모니터링 | 노트북 예제 |
빠른 데이터 로깅 예제
통합 환경에서 데이터를 로깅하는 기본 패턴은 이렇게 생겼어요.
#dataframe
logger.log_dataframe(df)
#dict
logger.log({"name": 1})
#images
logger.log_images("path/to/image.png")
whylogs는 구조화·비구조화 데이터를 모두 지원하고, 컬럼 단위로 데이터의 근사 통계와 스케치(sketch)를 수집해 통계 프로파일로 만든다.
WhyLabs 연동
WhyLabs는 whylogs 프로파일을 최대한 활용할 수 있게 만든 관리형 서비스예요. WhyLabs에 프로파일을 올리면 자동 모니터링을 설정하고, 데이터·ML 시스템 전체에 대한 관측성을 얻을 수 있어요.
플랫폼에서 접속 자격 증명을 얻은 뒤 파이썬 환경에 설정하고, 데이터를 로깅한 다음 WhyLabs에 기록하면 돼요. 이렇게 하면 프로파일 기반의 지속 모니터링과 문제 디버깅이 가능해져요.