AWQ 논문 (보호 채널·양자화 원리)
AWQ 논문 (보호 채널·양자화 원리)
AWQ 논문(2023, Ji Lin 외)은 행 단위가 아닌 채널 단위로 가중치의 중요도를 판단한다는 점에서 기존 접근과 달라요. 관찰(empirical) 결과, 각 가중치가 똑같이 중요한 게 아니라는 점에서 출발해요.
핵심 통찰: 소수의 중요한 채널(활성화 값이 크게 나타나는 채널)을 보호하면 전체 양자화 오차가 크게 줄어든다. AWQ는 이 보호를 데이터 기반으로 찾아낸 스케일(scaling)을 적용해 구현해요.
보호 채널(protect salient channels) 아이디어
- LLM 가중치는 채널별 중요도가 매우 다름.
- 활성화 크기가 큰 채널이 모델 출력에 미치는 영향이 큼.
- AWQ는 이 salient(중요) 채널을 보호해 양자화 오차를 줄임.
GPTQ 대비 특징
- GPTQ는 2차 정보(헤시안) 기반의 행 단위 보정.
- AWQ는 활성화 인지(activation-aware) 접근으로, 보정 비용이 낮고 일반화가 좋음.
- 사후 훈련(post-training) 방식이라 원본 데이터 없이도 적용 가능.
벤치마크·수용
- Llama 계열에서 INT4 성능 유지.
- vLLM, TensorRT-LLM, TGI, FastChat, LMDeploy, transformers 등 다수 프레임워크에 통합.
- NVIDIA TensorRT-LLM·Google Vertex AI·Amazon SageMaker에도 채택.
더 알아보기
- 논문(arXiv): https://arxiv.org/abs/2306.00978
- 프로젝트: https://hanlab.mit.edu/projects/awq