LMDeploy 개요 — 효율 추론·양자화·분산 서버

LMDeploy 개요 — 효율 추론·양자화·분산 서버

LMDeploy는 LLM을 압축, 배포, 서빙하는 툴킷이에요. 문서 첫 문장부터 ""LMDeploy is a toolkit for compressing, deploying, and serving LLM""이라고 소개하죠.

출처: https://lmdeploy.readthedocs.io/en/latest/

핵심 기능을 짚어볼게요.

  • 효율적인 추론(Efficient Inference): 지속적 배치(persistent batch, 일명 continuous batching), 블록 단위 KV 캐시, 동적 split&fuse, 텐서 병렬, 고성능 CUDA 커널을 통해 vLLM 대비 최대 1.8배 높은 요청 처리량을 낼 수 있어요.
  • 효과적인 양자화(Effective Quantization): weight-only와 K/V 양자화를 지원하고, 4비트 추론 성능은 FP16보다 2.4배 높아요. 양자화 품질은 OpenCompass 평가로 확인했어요.
  • 손쉬운 분산 서버(Effortless Distribution Server): 요청 분배 서비스를 이용해 여러 머신·여러 카드에 멀티 모델 서비스를 쉽게 배포할 수 있어요.
  • 뛰어난 호환성(Excellent Compatibility): KV Cache Quant, AWQ, Automatic Prefix Caching을 동시에 쓸 수 있어요.

Apache 2.0 라이선스의 오픈소스고, 추론 엔진으로 TurboMind(고성능 커널)와 lmdeploy.pytorch(파이토치 엔진)를 모두 지원해요. 필요에 따라 엔진을 골라 쓰면 됩니다.

더 알아보기