LLM Compressor
LLM Compressor
LLM Compressor 는 vLLM 배포를 위해 모델을 최적화하는 라이브러리입니다. FP4, FP8, INT8, INT4 양자화 같은 기법 지원을 포함한 포괄적인 양자화 알고리즘 세트를 제공해요.
출처: 문서
본문
왜 LLM Compressor를 사용하나요? (Why use LLM Compressor?)
현대 LLM은 종종 16비트 또는 32비트 부동 소수점으로 저장된 수십억 개의 파라미터를 담고 있어 상당한 GPU 메모리가 필요하고 배포 옵션을 제한합니다. 양자화는 모델 가중치와 활성화의 정밀도를 더 작은 데이터 타입으로 줄여 메모리 요구 사항을 낮추면서도 추론 출력 품질을 유지합니다.
LLM Compressor는 다음 이점을 제공합니다.
- 메모리 풋프린트 축소: 더 작은 GPU에서 더 큰 모델을 실행할 수 있습니다.
- 추론 비용 절감: GPU당 더 많은 동시 사용자를 서빙해 프로덕션 배포에서 쿼리당 비용을 직접 줄입니다.
- 더 빠른 추론: 더 작은 데이터 타입은 더 적은 메모리 대역폭을 소모하며, 특히 메모리 바운드 워크로드에서 더 높은 처리량으로 이어지는 경우가 많습니다.
LLM Compressor는 양자화, 보정, 형식 변환의 복잡성을 처리해 즉시 vLLM에서 사용할 수 있는 모델을 만듭니다.
주요 기능 (Key features)
- 다중 양자화 알고리즘: AWQ, GPTQ, AutoRound, Round-to-Nearest 지원. QuIP 및 SpinQuant 스타일 변환과 KV 캐시 및 어텐션 양자화도 지원합니다.
- 다중 양자화 방법: FP8, INT8, INT4, NVFP4, MXFP4, 혼합 정밀도 양자화 지원.
- One-Shot 양자화: 최소한의 보정 데이터로 모델을 빠르게 양자화.
- vLLM 통합: compressed-tensors 형식으로 양자화된 모델을 vLLM으로 원활하게 배포.
- Hugging Face 호환성: Hugging Face Hub의 모델과 함께 동작.