ML 모니터링 빠른 시작
ML 모니터링 빠른 시작
Evidently로 주로 하는 두 번째 큰 일이 테이블형 데이터 품질과 데이터 드리프트(data drift) 테스트예요. 프로덕션에 배포된 ML 모델의 입력 데이터가 학습 시점과 달라지기 시작하면 모델 성능이 조용히 떨어지거든요. Evidently는 그 변화를 수치로 잡아내요.
데이터 드리프트란
모델을 학습할 때 봤던 데이터 분포와, 운영에서 실제로 들어오는 데이터 분포가 달라지는 현상을 데이터 드리프트라고 불러요. 시간이 지나면서 고객의 행동, 시장 상황, 입력 특징의 의미가 바뀌면 이런 일이 생기죠. Evidently는 이런 드리프트를 통계적으로 감지해서 리포트로 보여줘요.
Evidently가 드리프트 감지에 쓰는 대표적인 방법으로는 이런 것들이 있어요.
- 데이터 드리프트(Data Drift) 지표
- 임베딩 드리프트(Embedding Drift) 지표 — LLM/NLP 모델 운영에 특히 유용해요.
테이블형 데이터 품질
모델 입력이 되는 테이블형 데이터에 대해서는 누락값, 값 범위, 타입, 분포 변화 같은 품질 지표를 확인할 수 있어요. "이 컬럼에 갑자기 null이 많아졌네?" 같은 문제를 빠르게 발견하는 게 목표예요.
모니터링 전략 설계
운영 모니터링을 시작할 때는 어떤 지표를 볼지, 얼마나 자주 볼지 정하는 게 먼저예요. Evidently 공식 MLOps 가이드에서는 모델 모니터링 전략을 설계할 때 서비스 지연, 모델 정확도, 데이터 품질 같은 관점을 함께 고려하라고 안내해요. 드리프트가 감지됐을 때 어떻게 반응할지 대응 절차도 미리 정해 두는 게 좋아요.