cleanlab 개요

cleanlab 개요

cleanlab은 '데이터를 정리하면 모델도 좋아진다'는 접근에서 출발해요. 라벨 오류, 이상치, 중복 같은 문제를 자동으로 찾아내서, 지저분한 실제 데이터로도 더 좋은 모델을 만들 수 있게 해 주는 라이브러리예요.

출처: cleanlab Open-Source 문서

cleanlab은 ML 데이터셋의 데이터·라벨 문제를 자동으로 감지해요. 기존 모델을 활용해 데이터셋의 문제를 추정해서 고치면 더 좋은 모델을 학습할 수 있게 하는 데이터 중심 AI 패키지예요. 이미 ImageNet, MNIST 같은 유명 벤치마크 데이터셋에서 수천 개의 라벨 오류를 찾아내기도 했어요.

사용 방식이 간단한 게 특징이에요. 모델을 학습한 뒤 그 모델의 pred_probs(라벨 확률)를 cleanlab에 넘겨주면, 어떤 데이터가 라벨 오류인지 알려줘요.

from cleanlab import Datalab

lab = Datalab(data=your_dataset, label_name="column_name_of_labels")
lab.find_issues(features=feature_embeddings, pred_probs=pred_probs)
lab.report()  # 데이터셋의 이슈 요약

라벨 오류뿐 아니라 이상치(outlier), 근사 중복(near duplicates), 그룹별 성능 저하 같은 다양한 문제도 한 번에 찾아줘요. 지도 학습은 물론 LLM/RAG 응용의 데이터 품질까지 다루는 범용 데이터 중심 AI 도구예요.

더 알아보기