AutoGPTQ (HF 통합 구현체)
AutoGPTQ (HF 통합 구현체)
AutoGPTQ는 GPTQ 알고리즘 기반의 사용자 친화적인 API를 제공하는 LLM 양자화 패키지예요. FP16처럼 로드만 하면 GPTQ 양자화 모델을 쉽게 다룰 수 있게 만들어요.
현재 공식 문서는 **"AutoGPTQ는 유지보수가 중단(unmaintained)됐다 — 버그 수정·새 모델 지원은 GPTQModel을 쓰라"**고 안내해요. 과거에는 vLLM·Transformers·Optimum·PEFT 생태계의 GPTQ 지원을 촉발한 기여가 컸어요.
역할·기여
- GPTQ 알고리즘 기반 weight-only 양자화의 쉬운 사용.
- Marlin int4×fp16 행렬 곱 커널 지원(
use_marlin=True). - transformers·optimum·peft가
auto-gptq를 통합해 GPTQ 모델 실행·학습을 널리 접근 가능하게 함.
성능 참고 (AutoGPTQ 문서)
| model | GPU | num_beams | fp16 | gptq-int4 |
|---|---|---|---|---|
| llama-7b | 1xA100-40G | 1 | 18.87 | 25.53 |
| gpt-j 6b | 1xRTX3060-12G | 1 | OOM | 29.55 |
| gpt-j 6b | 1xRTX3060-12G | 4 | OOM | 47.36 |
이전 권장
신규 작업이라면 GPTQModel 또는 Transformers의 네이티브 GPTQ 지원을 우선 검토하세요. AutoGPTQ는 신규 기능이 거의 추가되지 않는 아카이브 상태예요.
더 알아보기
- 저장소: https://github.com/AutoGPTQ/AutoGPTQ
- GPTQModel: https://github.com/AutoGPTQ/GPTQModel (별도 확인 필요)