지식 증류 개요 — LLM 코스에서 배우는 개념

지식 증류 개요

'큰 모델은 좋지만 배포가 너무 무거워요'라는 고민에서 출발해요. 지식 증류(knowledge distillation)는 teacher(큰) 모델의 예측 분포를 student(작은) 모델이 배워 성능은 비슷하게, 크기는 훨씬 작게 만드는 기법이에요.

작동 원리

하드 라벨(정답 클래스)만 맞히는 대신, teacher 모델이 내는 **소프트 라벨(클래스 확률 분포)**을 student가 따라 배워요. 분포에는 클래스 간 유사성 같은 풍부한 정보가 들어 있어, 단순 하드 라벨 학습보다 전이가 잘 돼요.

teacher(logits) --softmax/temperature--> soft targets
student cross-entropy(soft targets) 학습

왜 효과적인가

  • 더 작은 모델로 추론·배포 비용 절감
  • teacher의 '판단의 미묘함'(예: 고양이↔사자 유사성)까지 전수
  • 초기화·데이터 증강 등과 결합해 성능 극대화

언제 쓰나

엣지·온디바이스 배포가 필요하거나, API 비용·지연을 줄이고 싶을 때 유용해요. 경량 모델 제품군(DistilBERT, SmolLM 등)이 대표 사례예요.

더 알아보기