Quantization-Aware Training — 양자화 손실을 훈련에 미리 반영
Quantization-Aware Training
모델을 int8로 바꾸면 크기와 추론이 빨라지지만 정확도가 떨어질 수 있어요. Quantization-Aware Training (QAT, 양자화 인식 학습) 은 훈련 중에 가짜 양자화(fake quantization)를 넣어 모델이 양자화 손실을 미리 감내하도록 만드는 기법이에요. PTQ보다 높은 정확도를 얻을 수 있어요.
이 카테고리의 문서
- 개요: QAT 개요 — fake quantization과 prepare·convert
- 핵심 기능: PyTorch 2 Export QAT 실전 튜토리얼
- 실전·API: quantize_qat API — 훈련으로 양자화된 모델 만들기