LLM Compressor
LLM Compressor (LLM Compressor)
모델을 양자화해서 배포하려면 도구 선택이 실제로는 꽤 중요해요. LLM Compressor는 vLLM과 함께 배포할 모델을 최적화하기 위해 만들어진 라이브러리인데, FP4·FP8·INT8·INT4 같은 다양한 양자화 알고리즘을 한곳에서 다룰 수 있어요. 이 페이지에서 LLM Compressor가 왜 유용한지 그 핵심을 살펴볼게요.
왜 LLM Compressor를 쓰나? (Why use it?)
현대 LLM은 수십억 개의 파라미터를 16비트나 32비트 부동소수점으로 저장해서, GPU 메모리를 많이 잡아먹고 배포 옵션도 제한돼요. 양자화는 모델 웨이트와 활성화의 정밀도를 더 작은 데이터 타입으로 낮춰 메모리 요구량을 줄이면서도 추론 출력 품질은 유지해요.
LLM Compressor가 주는 이점은 실질적이에요:
- 메모리 사용량 감소: 더 큰 모델을 더 작은 GPU에서 돌려요.
- 추론 비용 절감: GPU 한 장으로 더 많은 동시 사용자를 처리해, 프로덕션에서 쿼리당 비용이 직접 줄어요.
- 더 빠른 추론: 데이터 타입이 작을수록 메모리 대역폭 소비가 줄어서, 특히 메모리 바운드 워크로드에서 처리량이 올라가요.
LLM Compressor는 양자화·캘리브레이션·포맷 변환의 복잡함을 대신 처리해 주고, vLLM에서 바로 쓸 수 있는 모델을 만들어 줍니다.
주요 특징 (Key features)
- 여러 양자화 알고리즘: AWQ, GPTQ, AutoRound, 그리고 Round-to-Nearest 지원. 여기에 QuIP·SpinQuant 스타일 변환과 KV 캐시·어텐션 양자화도 포함돼요.
- 여러 양자화 방식: FP8, INT8, INT4, NVFP4, MXFP4, 혼합 정밀도 양자화 지원.
- 원샷(One-Shot) 양자화: 최소한의 캘리브레이션 데이터로 모델을 빠르게 양자화.
- vLLM 통합: compressed-tensors 포맷으로 양자화된 모델을 vLLM에서 매끄럽게 배포.
- Hugging Face 호환: Hugging Face Hub의 모델과 함께 사용 가능.