vLLM 사용하기

vLLM 사용하기 (Using vLLM)

vLLM을 설치하고 나면 어떻게 쓰는 걸까요? vLLM의 사용 패턴은 크게 세 갈래로 나뉘어요. 단일 모델 인스턴스를 돌리는 추론/서빙, 프로덕션을 위한 확장 배포, 그리고 RLHF 같은 훈련/미세조정까지요. 이 문서는 그 전체 지도를 간단히 보여줍니다.

출처: vLLM 공식 문서 — usage

시작하기 전에

먼저 vLLM을 선택한 디바이스(Python 또는 Docker 환경)에 설치해야 해요.

세 가지 사용 패턴

그다음 vLLM은 다음 사용 패턴을 지원해요.

각 패턴으로 들어가면 더 자세한 하위 문서들이 이어져요. 예를 들어 추론/서빙은 오프라인 추론, 온라인 서빙, 그리고 데이터 병렬·컨텍스트 병렬·전문가 병렬 같은 다양한 병렬 배포 전략을 다루고, 훈련은 RLHF부터 비동기 RL, 가중치 전송까지 포괄합니다.

더 알아보기 (Learn more)