Knowledge Distillation — 큰 모델의 지식을 작은 모델로
Knowledge Distillation
큰 모델이 가진 능력을 작은 모델로 옮길 수 있다면, 배포가 훨씬 가벼워져요. **지식 증류(knowledge distillation)**는 큰(teacher) 모델이 생성한 소프트 라벨(확률 분포)을 작은(student) 모델이 학습하도록 해, 크게 줄어든 크기로도 높은 성능을 유지하는 기법이에요.
이 카테고리의 문서
- 개요: LLM 코스 5장 — 지식 증류 개념
- 핵심 기능: Transformers의 distillation 과정
- 실전·API: Trainer로 파인튜닝하며 증류 이해하기