GPTQ (포스트 트레이닝 양자화)
GPTQ (포스트 트레이닝 양자화)
GPTQ(Accurate Post-Training Quantization for Generative Pre-trained Transformers)는 생성형 사전학습 Transformer(GPT·OPT)를 위한 1회(one-shot) 가중치 양자화 방법이에요. IST Austria의 Elias Frantar 외가 개발했고, ICLR 2023에 발표됐어요.
가중치를 3~4비트로 줄이면서 정확도 저하를 거의 없애는 게 핵심이에요. 175B 파라미터 모델도 약 4 GPU-시간이면 양자화할 수 있고, 이를 단일 GPU에서 생성 추론이 가능하게 만들었어요. 표준 구현은 GitHub의 IST-DASLab/gptq예요.
핵심 개념
- One-shot PTQ — 사후 학습 없이 한 번에 양자화
- 2차 정보(헤시안) — 근사 2차 정보로 오차 보정
- 3/4-bit — 비트 폭 극단 절감
- AutoGPTQ — 사용자 친화적 구현체
이 카테고리의 문서
- 논문 원리: GPTQ 알고리즘과 성능
- 공식 구현: IST-DASLab/gptq 저장소
- AutoGPTQ: HF 통합 구현체