vLLM

vLLM

vLLM은 대규모 언어 모델을 고속 추론·서빙하는 오픈소스 라이브러리예요. 파이썬 코드에서 쓰는 오프라인 방식과, OpenAI 호환 HTTP 서버로 띄우는 온라인 서빙 방식을 모두 지원해요.