Knowledge Distillation — 큰 모델의 지식을 작은 모델로

Knowledge Distillation

큰 모델이 가진 능력을 작은 모델로 옮길 수 있다면, 배포가 훨씬 가벼워져요. **지식 증류(knowledge distillation)**는 큰(teacher) 모델이 생성한 소프트 라벨(확률 분포)을 작은(student) 모델이 학습하도록 해, 크게 줄어든 크기로도 높은 성능을 유지하는 기법이에요.

이 카테고리의 문서

  • 개요: LLM 코스 5장 — 지식 증류 개념
  • 핵심 기능: Transformers의 distillation 과정
  • 실전·API: Trainer로 파인튜닝하며 증류 이해하기

출처: https://huggingface.co/learn/llm-course/en/chapter5/4