LMDeploy — LLM 압축·배포·서빙 툴킷
LMDeploy — LLM 압축·배포·서빙 툴킷
큰 언어 모델을 실제 서비스에 올리려면 추론 성능, 양자화, 배포를 한 번에 고민해야 해요. LMDeploy는 이 세 가지를 묶어 주는 툴킷이에요. 지속적 배치(persistent batching), 블록 단위 KV 캐시, 고성능 CUDA 커널 덕분에 vLLM보다 높은 요청 처리량을 내기도 해요.
이 허브에서는 LMDeploy의 개요, OpenAI 호환 서버 구성, 그리고 W4A16 양자화를 살펴볼게요.