Quantization-Aware Training — 양자화 손실을 훈련에 미리 반영

Quantization-Aware Training

모델을 int8로 바꾸면 크기와 추론이 빨라지지만 정확도가 떨어질 수 있어요. Quantization-Aware Training (QAT, 양자화 인식 학습) 은 훈련 중에 가짜 양자화(fake quantization)를 넣어 모델이 양자화 손실을 미리 감내하도록 만드는 기법이에요. PTQ보다 높은 정확도를 얻을 수 있어요.

이 카테고리의 문서

  • 개요: QAT 개요 — fake quantization과 prepare·convert
  • 핵심 기능: PyTorch 2 Export QAT 실전 튜토리얼
  • 실전·API: quantize_qat API — 훈련으로 양자화된 모델 만들기

출처: https://docs.pytorch.org/ao/main/workflows/qat.html