TorchServe
TorchServe
TorchServe는 훈련된 PyTorch 모델을 프로덕션에서 서빙·확장하기 쉽게 만들어 주는 오픈소스 모델 서버예요. 모델을 하나의 아카이브(.mar)로 패키징하고 REST·gRPC API로 배포해서, 온프레미스든 클라우드든 같은 코드로 어디서나 띄울 수 있어요.
핵심 특징
- 모델 아카이브(.mar): 모델 가중치·핸들러·설정을 하나의 파일로 묶어 배포
- 다중 모델/워커 관리: 모델별 워커 수·GPU 할당을 동적으로 조절 (Management API)
- 배치 추론: 여러 요청을 모아 한 번에 추론해 GPU·CPU 자원을 최적 사용
- 대형 모델 서빙: vLLM·PiPPy·DeepSpeed와 연동해 한 GPU에 안 들어가는 LLM을 여러 GPU로 분산 서빙
- LLM 배포: vLLM 통합·llm_launcher 스크립트로 LLM을 빠르게 배포
이 카테고리의 문서
- LLM 배포: vLLM 통합 기반 LLM 퀵스타트
- 대형 모델 추론: multi-GPU 분산 (vLLM·PiPPy·DeepSpeed)
- 배치 추론: batch_size·max_batch_delay 설정
- 성능 가이드: torch.compile·ORT·TensorRT·BetterTransformer 최적화