DistilBERT 소개 — 지식 증류로 더 작고 더 빠르게

DistilBERT 소개

대규모 언어 모델을 엣지나 제한된 컴퓨팅 환경에서 돌리기는 어려워요. DistilBERT는 사전 학습 단계에서 지식 증류를 적용해 작은 범용 언어 표현 모델을 만들어 이 문제를 푸는 방법이에요. 2019년 arXiv:1910.01108 논문에서 제안됐고, Hugging Face가 오픈소스로 공개했어요.

출처: https://arxiv.org/abs/1910.01108

핵심 아이디어

대부분의 이전 연구는 태스크 특화 모델을 만들 때 증류를 썼지만, DistilBERT는 사전 학습 단계에서 증류를 사용해요. 그 덕분에 커다란 BERT가 프리트레이닝 동안 배운 귀납적 편향(inductive bias)을 그대로 물려받을 수 있어요.

세 개의 손실을 합친 트리플 로스

  • 언어 모델링 손실(language modeling loss) — 원래 BERT의 학습 목표 유지
  • 증류 손실(distillation loss) — teacher인 BERT와 같은 확률을 내도록 학습
  • 코사인 거리 손실(cosine-distance loss) — 히든 스테이트를 teacher와 최대한 가깝게

정량적 결과

  • BERT 크기를 40% 줄임
  • 언어 이해 능력의 97% 유지
  • 60% 더 빠른 추론
  • 더 싸게 사전 학습, 온디바이스 계산에서 능력 검증

더 알아보기