AWQ 라이브러리 개요

AWQ 라이브러리 개요

AWQ는 효율적이고 정확한 저비트(INT3/4) 가중치 양자화를 LLM에 적용하는 라이브러리예요. 지시 튜닝(instruct) 모델과 멀티모달(VLM) 모델까지 폭넓게 지원해요.

MIT han-lab에서 개발했고 MLSys 2024에서 Best Paper Award를 받았어요. AWQ 기반으로 엣지 디바이스에서 LLM·VLM을 빠르게 돌리는 TinyChat도 함께 제공돼요.

출처: https://github.com/mit-han-lab/llm-awq

주요 특징

  • AWQ search — 정확한 양자화를 위한 탐색.
  • 사전 계산 모델 주(AWQ model zoo) — Llama-1/2/3, OPT, CodeLlama, StarCoder, Vicuna, VILA, LLaVA 등.
  • 메모리 효율 4-bit Linear — PyTorch 구현.
  • 효율적 CUDA 커널 — 콘텍스트·디코딩 단계 추론 가속.
  • 엣지 추론 — TinyChat 2.0, Jetson Orin 같은 저전력 플랫폼.

설치

git clone https://github.com/mit-han-lab/llm-awq
cd llm-awq
conda create -n awq python=3.10 -y
conda activate awq
pip install --upgrade pip
pip install -e .
cd awq/kernels
python setup.py install
pip install flash-attn --no-build-isolation

TinyChat 속도 예시

  • LLaMA-3-8B on RTX 4090 — W4A16은 FP16 대비 2.7x 빠름.
  • LLaMA-3-8B on Jetson Orin — 2.9x.
  • VILA·LLaVA 등 비전 모델도 4-bit 추론 지원.

더 알아보기