GPTQ 논문 (알고리즘 원리)
GPTQ 논문 (알고리즘 원리)
GPTQ 논문(2022, Frantar 외)은 GPT·OPT 모델의 막대한 연산·저장 비용을 다뤄요. 거대 모델은 추론조차도 여러 고성능 GPU가 필요해서 사용성이 떨어지는 문제를 풀려 했어요.
기존 압축 기법은 GPT 규모·복잡도에 한계가 있었어요. 저자들은 **근사 2차 정보(approximate second-order information)**에 기반한 새 1회성 가중치 양자화 방법을 제안했는데, 이것이 정확하고 효율적이에요. 175B 모델을 약 4 GPU-시간으로 양자화하고 비트 폭을 3~4비트로 줄이면서도 정확도 저하가 거의 없었어요.
주요 결과 (논문)
- 175B 파라미터 모델을 약 4 GPU-시간에 양자화.
- 가중치당 비트 폭을 3 또는 4비트로 감소.
- 무압축 베이스라인 대비 정확도 저하 무시할 수준.
- 기존 one-shot 양자화 기법보다 2배 이상 압축 이득.
- 단일 GPU에서 175B 모델 생성 추론 최초 달성.
- 2-bit·ternary(3값) 극한 양자화에서도 합리적 정확도.
추론 속도 (FP16 대비)
- 고급 GPU(NVIDIA A100): 약 3.25×.
- 비용 효율 GPU(NVIDIA A6000): 약 4.5×.
구현
더 알아보기
- 논문(arXiv): https://arxiv.org/abs/2210.17323
- 공식 저장소: https://github.com/IST-DASLab/gptq