GPTQ (포스트 트레이닝 양자화)

GPTQ (포스트 트레이닝 양자화)

GPTQ(Accurate Post-Training Quantization for Generative Pre-trained Transformers)는 생성형 사전학습 Transformer(GPT·OPT)를 위한 1회(one-shot) 가중치 양자화 방법이에요. IST Austria의 Elias Frantar 외가 개발했고, ICLR 2023에 발표됐어요.

가중치를 3~4비트로 줄이면서 정확도 저하를 거의 없애는 게 핵심이에요. 175B 파라미터 모델도 약 4 GPU-시간이면 양자화할 수 있고, 이를 단일 GPU에서 생성 추론이 가능하게 만들었어요. 표준 구현은 GitHub의 IST-DASLab/gptq예요.

핵심 개념

  • One-shot PTQ — 사후 학습 없이 한 번에 양자화
  • 2차 정보(헤시안) — 근사 2차 정보로 오차 보정
  • 3/4-bit — 비트 폭 극단 절감
  • AutoGPTQ — 사용자 친화적 구현체

이 카테고리의 문서

  • 논문 원리: GPTQ 알고리즘과 성능
  • 공식 구현: IST-DASLab/gptq 저장소
  • AutoGPTQ: HF 통합 구현체

출처: https://arxiv.org/abs/2210.17323