Anyscale — vLLM 배포
Anyscale — vLLM 배포
Anyscale는 Ray의 제작자들이 만든 관리형 멀티클라우드 플랫폼입니다. AWS, GCP, Azure 계정 안에서 Ray 클러스터의 전체 라이프사이클을 자동화하여, 오픈소스 Ray의 유연성을 제공하면서도 Kubernetes 컨트롤 플레인 유지, 오토스케일러 설정, 관측성 스택 관리, examples/online_serving/run_cluster.sh 같은 헬퍼 스크립트로 head/worker 노드를 수동 관리하는 운영 오버헤드를 없애 줍니다.
출처: 문서
본문
vLLM으로 대형 언어 모델(LLM)을 서빙할 때, Anyscale은 프로덕션 준비가 된 HTTPS 엔드포인트나 장애 허용(fault-tolerant) 배치 추론 작업을 빠르게 프로비저닝할 수 있습니다.
Anyscale에서 프로덕션 준비 vLLM 빠른 시작
- 오프라인 배치 추론 (Offline batch inference)
- vLLM 서비스 배포 (Deploy vLLM services)
- 데이터셋 큐레이션 (Curate a dataset)
- LLM 파인튜닝 (Finetune an LLM)
vLLM의 OpenAI 호환 서빙을 그대로 활용해, 완전 관리형 인프라에서 비용 효율적이고 확장 가능한 추론 서비스를 올릴 수 있습니다. 특히 운영 부담 없이 레이턴시 요구 사항에 맞춘 자동 스케일링이 필요한 프로덕션 서빙에 적합합니다.
기본적으로 vLLM을 Ray 클러스터 위에서 실행하므로, Anyscale의 기능으로 GPU 노드 추가/제거, 헬스 체크, 다중 클라우드 배포를 코드와 함께 관리할 수 있습니다. vLLM의 vllm serve 명령을 Anyscale 서비스로 감싸면 HTTPS 엔드포인트가 자동으로 생성되고, 배치 추론은 작업(job)으로 제출해 장애 허용을 누릴 수 있습니다.
# 서빙 예시 (Anyscale 서비스로 wrapping)
vllm serve meta-llama/Meta-Llama-3-8B-Instruct \
--tensor-parallel-size 1 \
--max-model-len 4096
자가 호스팅 대비 얻는 이점은 크게 세 가지입니다.
- 운영 자동화 — 클러스터 수명주기, 오토스케일러, 관측성을 Anyscale이 관리.
- 멀티클라우드 — AWS/GCP/Azure 어느 계정에서든 동일한 워크플로우로 배포.
- 프로덕션 준비 — HTTPS 엔드포인트와 장애 허용 배치 작업을 즉시 프로비저닝.
더 알아보기 (Learn more)
- 모든 배포 프레임워크 — vLLM과 연동되는 각종 프레임워크 목록
- CLI 가이드 —
vllm serve사용법