AWQ (Activation-aware Weight Quantization)

AWQ (Activation-aware Weight Quantization)

AWQ(Activation-aware Weight Quantization)는 LLM 압축·가속을 위한 저비트(INT3/4) 가중치 양자화 방법이에요. MIT의 mit-han-lab에서 개발했고, MLSys 2024 Best Paper Award를 받았어요.

핵심 아이디어는 "가중치를 양자화할 때 모든 가중치가 똑같이 중요하진 않다"는 거예요. 활성화(activation) 크기가 큰 채널에 해당하는 가중치를 보호해서, 양자화 오차를 최소화하면서 메모리와 지연을 줄여요. 지시 튜닝 모델과 멀티모달 모델까지 지원해요.

핵심 개념

  • Activation-aware — 활성화가 큰 중요 채널 보호
  • INT3/INT4 양자화 — 저비트 가중치로 메모리 절감
  • TinyChat — 엣지 GPU용 효율적 추론
  • AutoAWQ — 확장·통합이 쉬운 커뮤니티 구현

이 카테고리의 문서

  • 라이브러리 개요: AWQ 알고리즘과 지원 모델
  • 논문 원리: 보호 채널·양자화 원리
  • AutoAWQ: 사용하기 쉬운 구현체

출처: https://github.com/mit-han-lab/llm-awq