vLLM 사용하기
vLLM 사용하기 (Using vLLM)
vLLM을 사용하기 전에 먼저 선택한 디바이스(Python 또는 Docker 환경)에 vLLM을 설치해야 합니다. 설치 후에는 추론·배포·학습의 세 가지 주요 사용 패턴을 활용할 수 있습니다.
출처: 문서
본문
먼저, 선택한 디바이스(Python 또는 Docker 환경)에 vLLM을 설치해야 합니다.
그런 다음 vLLM은 다음과 같은 사용 패턴을 지원합니다:
- 추론과 서빙 (Inference and Serving): 모델 단일 인스턴스 실행
- 배포 (Deployment): 프로덕션을 위해 모델 인스턴스 확장
- 학습 (Training): 모델 학습 또는 미세 조정
각 패턴을 언제 쓰나요?
- 추론/서빙은 모델을 한 번에 하나씩(오프라인) 또는 지속적인 서버(온라인)로 실행해 응답을 생성할 때 사용합니다. 자체 코드에서
LLM클래스로 오프라인 추론을 하거나,vllm serve로 OpenAI 호환 API 서버를 띄울 수 있습니다. - 배포는 여러 모델 인스턴스를 확장해 대량 트래픽을 처리하거나 고가용성을 확보할 때 사용합니다. Docker 컨테이너, Kubernetes, 헬름 등을 통해 프로덕션 환경을 구성합니다.
- 학습은 RLHF·GRPO 같은 강화학습이나 모델 미세 조정을 수행할 때 사용합니다. vLLM의 빠른 인퍼런스를 rollout 생성에 활용합니다.
시작 방법과 설치 절차, 지원 모델 목록은 각 섹션의 문서에서 자세히 확인할 수 있습니다.