Quantization — 모델 가중치를 저비트로 압축하는 최적화

Quantization

모델이 커질수록 메모리가 부족해지는 문제가 앞에 놓여요. **양자화(quantization)**는 가중치를 fp32 같은 고정밀도에서 fp16·int8·int4 같은 저비트로 바꿔 메모리 요구를 줄이는 기법이에요. 정확도를 최대한 보존하면서 로딩·추론 부담을 낮추는 게 핵심이고, Transformers는 캘리브레이션이 필요한 방법부터 즉시 양자화(on-the-fly)까지 다양한 방식을 지원해요.

이 카테고리의 문서

  • 개요: Transformers 양자화 개요와 방법 선택표
  • 핵심 기능: LLM 코스 6장의 양자화 개념·적용
  • 실전·API: HQQ로 즉시 양자화하고 추론 속도 올리기

출처: https://huggingface.co/docs/transformers/en/quantization/overview