공식 구현 (IST-DASLab/gptq)

공식 구현 (IST-DASLab/gptq)

IST-DASLab/gptq는 ICLR 2023 논문 "GPTQ: Accurate Post-training Quantization of Generative Pretrained Transformers"의 공식 참조 구현 저장소예요.

GPTQ 알고리즘의 효율적 구현, OPT·BLOOM 계열의 2/3/4비트 압축, perplexity·ZeroShot 평가, 3-bit CUDA 커널 등을 포함해요.

출처: https://github.com/IST-DASLab/gptq

포함 기능

  • gptq.py — GPTQ 알고리즘 효율 구현.
  • opt.py, bloom.py — OPT·BLOOM 계열 2/3/4비트 압축(그룹 양자화 포함).
  • zeroShot/ — 여러 언어 생성 태스크 perplexity·성능 평가.
  • quant_cuda_kernel.cu 외 — 3-bit 양자화 행렬 × FP 벡터 곱 CUDA 커널.

예시 명령

python llama.py LLAMA_HF_FOLDER c4 --wbits 4 --true-sequential --act-order --new-eval
  • --true-sequential — Transformer 블록 내에서도 순차 양자화.
  • --act-order — 활성화 크기가 큰 열부터 양자화.
  • --static-groups — 그룹 그리드를 사전 결정해 --act-order와 함께 써도 추론 변경 불필요.

결과 (Wiki2 PPL)

Wiki2 PPL FP16 4bit-RTN 4bit-GPTQ 3bit-GPTQ
LLaMa-7B 5.68 6.29 6.09 8.07
LLaMa-13B 5.09 5.53 5.36 6.63
LLaMa-65B 3.53 3.92 3.84 5.04

더 알아보기