LLM 서빙 — Ray Serve + vLLM 조합
LLM 서빙 — Ray Serve + vLLM 조합
Anyscale 서비스로 LLM을 프로덕션에 배포할 때는 세 구성요소가 함께 움직여요. Ray Serve(오케스트레이션·스케일링), vLLM(추론), Anyscale(인프라 관리)입니다.
vLLM의 주요 최적화
Ray Serve가 vLLM과 통합되면서 이런 최적화를 그대로 활용합니다.
- PagedAttention — KV 캐시를 가상 메모리처럼 관리해 메모리 단편화 제거.
- Continuous batching — 새 요청을 처리 배치에 계속 추가해 GPU 활용 극대화.
- 최적화 CUDA 커널 — FlashAttention 통합, INT4·FP8 같은 양자화 지원.
배포 규모별 튜토리얼
모델 크기에 따라 접근이 달라요.
| 모델 크기 | 예시 | 배치 방식 |
|---|---|---|
| 소형 | Llama 3 8B, Mistral 7B, Phi-2 | 단일 GPU |
| 중형 | Llama 3 70B, Mixtral 8x7B | 단일 노드 4~8 GPU 텐서 병렬 |
| 대형 | DeepSeek-R1, Llama-Nemotron 253B | 멀티노드 클러스터 파이프라인 병렬 |
| 비전 | Qwen 2.5-VL, Pixtral-12B | 이미지·텍스트 입력 |
| 추론 | QwQ-32B | 장문맥·코딩·도구 사용 |
모델에 따라 LLMConfig에서 engine_kwargs로 vLLM을 조정합니다.
더 알아보기
https://docs.anyscale.com/llm— LLM·에이전트 AI 기능 개요https://docs.ray.io/en/latest/serve/llm/index.html— Ray Serve LLM 문서