공식 구현 (IST-DASLab/gptq)
공식 구현 (IST-DASLab/gptq)
IST-DASLab/gptq는 ICLR 2023 논문 "GPTQ: Accurate Post-training Quantization of Generative Pretrained Transformers"의 공식 참조 구현 저장소예요.
GPTQ 알고리즘의 효율적 구현, OPT·BLOOM 계열의 2/3/4비트 압축, perplexity·ZeroShot 평가, 3-bit CUDA 커널 등을 포함해요.
포함 기능
gptq.py— GPTQ 알고리즘 효율 구현.opt.py,bloom.py— OPT·BLOOM 계열 2/3/4비트 압축(그룹 양자화 포함).zeroShot/— 여러 언어 생성 태스크 perplexity·성능 평가.quant_cuda_kernel.cu외 — 3-bit 양자화 행렬 × FP 벡터 곱 CUDA 커널.
예시 명령
python llama.py LLAMA_HF_FOLDER c4 --wbits 4 --true-sequential --act-order --new-eval
--true-sequential— Transformer 블록 내에서도 순차 양자화.--act-order— 활성화 크기가 큰 열부터 양자화.--static-groups— 그룹 그리드를 사전 결정해--act-order와 함께 써도 추론 변경 불필요.
결과 (Wiki2 PPL)
| Wiki2 PPL | FP16 | 4bit-RTN | 4bit-GPTQ | 3bit-GPTQ |
|---|---|---|---|---|
| LLaMa-7B | 5.68 | 6.29 | 6.09 | 8.07 |
| LLaMa-13B | 5.09 | 5.53 | 5.36 | 6.63 |
| LLaMa-65B | 3.53 | 3.92 | 3.84 | 5.04 |