Ray Serve
Ray Serve
Ray Serve는 확장 가능한 모델 서빙 라이브러리로, 온라인 추론 API를 손쉽게 만들 수 있게 해줘요. 프레임워크에 구애받지 않아서 PyTorch·TensorFlow·Keras 같은 딥러닝 모델부터 Scikit-Learn 모델, 심지어 임의의 Python 비즈니스 로직까지 하나의 툴킷으로 서빙할 수 있어요. 특히 대규모 언어 모델(LLM) 서빙에 특화된 기능(응답 스트리밍, 동적 요청 배칭, 멀티노드/Multi-GPU 서빙 등)을 기본으로 제공해서, 챗봇류 애플리케이션을 빠르게 프로덕션에 올리기 좋아요.
핵심 특징
- 프레임워크 무관: 어떤 Python 모델이든
@serve.deployment로 감싸면 바로 서빙 가능 - 모델 구성(Composition): 여러 모델·비즈니스 로직을 하나의 앱으로 조합, 각 단계를 독립적으로 스케일
- LLM 서빙 최적화: 응답 스트리밍, 동적 요청 배칭, 멀티노드/Multi-GPU 서빙, vLLM·SGLang 백엔드 연동
- 다중 모델/멀티플렉싱: 모델 풀을 공유해 비용을 줄이고 트래픽을 부하 분산
- 자동 스케일링: 트래픽에 따라 레플리카를 자동 증감, GPU·CPU 리소스를 유연하게 배분
- MLOps 연동: MLflow·Hugging Face Hub·Weights & Biases 같은 모델 레지스트리와 자연스럽게 통합
이 카테고리의 문서
- 핵심 개념: Deployment·Application·DeploymentHandle·Ingress
- 모델 구성: DeploymentHandle로 여러 모델을 하나의 앱으로 조합
- 모델 멀티플렉싱: 레플리카 풀을 공유하며 여러 모델을 효율적으로 서빙
- 모델 레지스트리: MLflow·Hugging Face Hub 등과 통합해 서빙
- 자동 스케일링: 트래픽 기반 레플리카 증감
- 비동기 추론: 오래 걸리는 추론을 백그라운드 태스크로 처리