AutoGPTQ (HF 통합 구현체)

AutoGPTQ (HF 통합 구현체)

AutoGPTQ는 GPTQ 알고리즘 기반의 사용자 친화적인 API를 제공하는 LLM 양자화 패키지예요. FP16처럼 로드만 하면 GPTQ 양자화 모델을 쉽게 다룰 수 있게 만들어요.

현재 공식 문서는 **"AutoGPTQ는 유지보수가 중단(unmaintained)됐다 — 버그 수정·새 모델 지원은 GPTQModel을 쓰라"**고 안내해요. 과거에는 vLLM·Transformers·Optimum·PEFT 생태계의 GPTQ 지원을 촉발한 기여가 컸어요.

출처: https://github.com/AutoGPTQ/AutoGPTQ

역할·기여

  • GPTQ 알고리즘 기반 weight-only 양자화의 쉬운 사용.
  • Marlin int4×fp16 행렬 곱 커널 지원(use_marlin=True).
  • transformers·optimum·peft가 auto-gptq를 통합해 GPTQ 모델 실행·학습을 널리 접근 가능하게 함.

성능 참고 (AutoGPTQ 문서)

model GPU num_beams fp16 gptq-int4
llama-7b 1xA100-40G 1 18.87 25.53
gpt-j 6b 1xRTX3060-12G 1 OOM 29.55
gpt-j 6b 1xRTX3060-12G 4 OOM 47.36

이전 권장

신규 작업이라면 GPTQModel 또는 Transformers의 네이티브 GPTQ 지원을 우선 검토하세요. AutoGPTQ는 신규 기능이 거의 추가되지 않는 아카이브 상태예요.

더 알아보기