vLLM 사용하기
vLLM 사용하기 (Using vLLM)
vLLM을 설치하고 나면 어떻게 쓰는 걸까요? vLLM의 사용 패턴은 크게 세 갈래로 나뉘어요. 단일 모델 인스턴스를 돌리는 추론/서빙, 프로덕션을 위한 확장 배포, 그리고 RLHF 같은 훈련/미세조정까지요. 이 문서는 그 전체 지도를 간단히 보여줍니다.
시작하기 전에
먼저 vLLM을 선택한 디바이스(Python 또는 Docker 환경)에 설치해야 해요.
세 가지 사용 패턴
그다음 vLLM은 다음 사용 패턴을 지원해요.
- 추론과 서빙 (Inference and Serving): 모델의 단일 인스턴스를 실행합니다.
- 배포 (Deployment): 프로덕션을 위해 모델 인스턴스를 확장합니다.
- 훈련 (Training): 모델을 훈련하거나 미세조정합니다.
각 패턴으로 들어가면 더 자세한 하위 문서들이 이어져요. 예를 들어 추론/서빙은 오프라인 추론, 온라인 서빙, 그리고 데이터 병렬·컨텍스트 병렬·전문가 병렬 같은 다양한 병렬 배포 전략을 다루고, 훈련은 RLHF부터 비동기 RL, 가중치 전송까지 포괄합니다.