AWQ 라이브러리 개요
AWQ 라이브러리 개요
AWQ는 효율적이고 정확한 저비트(INT3/4) 가중치 양자화를 LLM에 적용하는 라이브러리예요. 지시 튜닝(instruct) 모델과 멀티모달(VLM) 모델까지 폭넓게 지원해요.
MIT han-lab에서 개발했고 MLSys 2024에서 Best Paper Award를 받았어요. AWQ 기반으로 엣지 디바이스에서 LLM·VLM을 빠르게 돌리는 TinyChat도 함께 제공돼요.
주요 특징
- AWQ search — 정확한 양자화를 위한 탐색.
- 사전 계산 모델 주(AWQ model zoo) — Llama-1/2/3, OPT, CodeLlama, StarCoder, Vicuna, VILA, LLaVA 등.
- 메모리 효율 4-bit Linear — PyTorch 구현.
- 효율적 CUDA 커널 — 콘텍스트·디코딩 단계 추론 가속.
- 엣지 추론 — TinyChat 2.0, Jetson Orin 같은 저전력 플랫폼.
설치
git clone https://github.com/mit-han-lab/llm-awq
cd llm-awq
conda create -n awq python=3.10 -y
conda activate awq
pip install --upgrade pip
pip install -e .
cd awq/kernels
python setup.py install
pip install flash-attn --no-build-isolation
TinyChat 속도 예시
- LLaMA-3-8B on RTX 4090 — W4A16은 FP16 대비 2.7x 빠름.
- LLaMA-3-8B on Jetson Orin — 2.9x.
- VILA·LLaVA 등 비전 모델도 4-bit 추론 지원.