LLM 서빙 — Ray Serve + vLLM 조합

LLM 서빙 — Ray Serve + vLLM 조합

Anyscale 서비스로 LLM을 프로덕션에 배포할 때는 세 구성요소가 함께 움직여요. Ray Serve(오케스트레이션·스케일링), vLLM(추론), Anyscale(인프라 관리)입니다.

출처: https://docs.anyscale.com/llm/serving

vLLM의 주요 최적화

Ray Serve가 vLLM과 통합되면서 이런 최적화를 그대로 활용합니다.

  • PagedAttention — KV 캐시를 가상 메모리처럼 관리해 메모리 단편화 제거.
  • Continuous batching — 새 요청을 처리 배치에 계속 추가해 GPU 활용 극대화.
  • 최적화 CUDA 커널 — FlashAttention 통합, INT4·FP8 같은 양자화 지원.

배포 규모별 튜토리얼

모델 크기에 따라 접근이 달라요.

모델 크기 예시 배치 방식
소형 Llama 3 8B, Mistral 7B, Phi-2 단일 GPU
중형 Llama 3 70B, Mixtral 8x7B 단일 노드 4~8 GPU 텐서 병렬
대형 DeepSeek-R1, Llama-Nemotron 253B 멀티노드 클러스터 파이프라인 병렬
비전 Qwen 2.5-VL, Pixtral-12B 이미지·텍스트 입력
추론 QwQ-32B 장문맥·코딩·도구 사용

모델에 따라 LLMConfig에서 engine_kwargs로 vLLM을 조정합니다.

더 알아보기

  • https://docs.anyscale.com/llm — LLM·에이전트 AI 기능 개요
  • https://docs.ray.io/en/latest/serve/llm/index.html — Ray Serve LLM 문서