Model Interpretability — 모델이 왜 그런 답을 냈는지 설명한다
Model Interpretability
모델이 높은 정확도를 내도 '왜 그런 판단을 했는지' 설명하지 못하면 신뢰하기 어려워요. Model Interpretability(모델 해석 가능성) 는 입력 특징이 예측에 얼마나 기여했는지 속성(attribution)으로 설명하는 기법이에요. PyTorch용 Captum과 모델 무관한 SHAP이 대표적이에요.
이 카테고리의 문서
- 개요: Captum — PyTorch 모델 해석 라이브러리
- 핵심 기능: SHAP — 게임 이론 기반 Shapley 값
- 실전·API: Captum IMDB 튜토리얼 — 토큰별 속성 시각화