Ray Serve

Ray Serve

Ray Serve는 확장 가능한 모델 서빙 라이브러리로, 온라인 추론 API를 손쉽게 만들 수 있게 해줘요. 프레임워크에 구애받지 않아서 PyTorch·TensorFlow·Keras 같은 딥러닝 모델부터 Scikit-Learn 모델, 심지어 임의의 Python 비즈니스 로직까지 하나의 툴킷으로 서빙할 수 있어요. 특히 대규모 언어 모델(LLM) 서빙에 특화된 기능(응답 스트리밍, 동적 요청 배칭, 멀티노드/Multi-GPU 서빙 등)을 기본으로 제공해서, 챗봇류 애플리케이션을 빠르게 프로덕션에 올리기 좋아요.

핵심 특징

  • 프레임워크 무관: 어떤 Python 모델이든 @serve.deployment로 감싸면 바로 서빙 가능
  • 모델 구성(Composition): 여러 모델·비즈니스 로직을 하나의 앱으로 조합, 각 단계를 독립적으로 스케일
  • LLM 서빙 최적화: 응답 스트리밍, 동적 요청 배칭, 멀티노드/Multi-GPU 서빙, vLLM·SGLang 백엔드 연동
  • 다중 모델/멀티플렉싱: 모델 풀을 공유해 비용을 줄이고 트래픽을 부하 분산
  • 자동 스케일링: 트래픽에 따라 레플리카를 자동 증감, GPU·CPU 리소스를 유연하게 배분
  • MLOps 연동: MLflow·Hugging Face Hub·Weights & Biases 같은 모델 레지스트리와 자연스럽게 통합

이 카테고리의 문서

  • 핵심 개념: Deployment·Application·DeploymentHandle·Ingress
  • 모델 구성: DeploymentHandle로 여러 모델을 하나의 앱으로 조합
  • 모델 멀티플렉싱: 레플리카 풀을 공유하며 여러 모델을 효율적으로 서빙
  • 모델 레지스트리: MLflow·Hugging Face Hub 등과 통합해 서빙
  • 자동 스케일링: 트래픽 기반 레플리카 증감
  • 비동기 추론: 오래 걸리는 추론을 백그라운드 태스크로 처리

출처: https://docs.ray.io/en/latest/serve/