vLLM 서빙 — 모델을 OpenAI 호환 서버로 배포하기

vLLM 서빙 — 모델을 OpenAI 호환 서버로 배포하기

모델을 학습했다면 이제 그 모델을 실제로 서빙해서 다른 프로그램이 API로 호출할 수 있게 할 차례예요. vLLM은 이 서빙 과정을 아주 간단하게 만들어 주는데요, vllm serve라는 명령 하나로 고성능 추론 서버를 띄울 수 있어요.

출처: https://docs.vllm.ai/

이 허브에서는 온라인 서빙의 기본 구성, OpenAI 호환 서버의 특징, 그리고 서버를 시작할 때 넘기는 serve 인자들을 차례로 살펴볼게요.