GPU 설치

GPU 설치 (GPU)

vLLM은 Python 라이브러리이고, 여러 GPU 변형을 지원해요. 자신의 GPU 종류를 선택해 벤더별 지침을 확인하면 됩니다.

  • NVIDIA CUDA: vLLM은 사전 컴파일된 C++와 CUDA(12.9) 바이너리를 포함해요.
  • AMD ROCm: ROCm 6.3 이상의 AMD GPU를 지원해요. ROCm 7.0과 ROCm 7.2.1용 사전 빌드 wheel을 제공합니다.
  • Intel XPU: Intel GPU 플랫폼에서 기본적인 모델 추론과 서빙을 지원해요.
  • Apple Silicon (vLLM-Metal): MLX를 컴퓨트 백엔드로 사용하는 커뮤니티 유지보수 하드웨어 플러그인으로 Apple Metal 프레임워크를 통해 네이티브 GPU 가속을 제공해요.

출처: vLLM 공식 문서 — getting_started-installation-gpu

요구사항 (Requirements)

  • OS: Linux
  • Python: 3.10 -- 3.13

NVIDIA CUDA

  • GPU: compute capability 7.5 이상 (예: T4, RTX20xx, A100, L4, H100, B200 등)

AMD ROCm

  • GPU: MI200s (gfx90a), MI300 (gfx942), MI350 (gfx950), Radeon RX 7900 series (gfx1100/1101), Radeon RX 9000 series (gfx1200/1201), Ryzen AI MAX / AI 300 Series (gfx1151/1150)
  • ROCm 6.3 이상 (MI350은 ROCm 7.0 이상, Ryzen AI MAX/AI 300은 ROCm 7.0.2 이상)

Intel XPU

  • 지원 하드웨어: Intel Data Center GPU, Intel ARC GPU
  • 의존성: vllm-xpu-kernels
  • Python: 3.12 (제공되는 vllm-xpu-kernels whl이 Python3.12 전용이라 반드시 필요)

Apple Silicon

  • OS: macOS Sonoma 이상, Apple Silicon, Metal 지원 활성화

참고: vLLM은 Windows를 네이티브 지원하지 않아요. Windows에서 vLLM을 쓰려면 WSL(Windows Subsystem for Linux)을 사용하거나 커뮤니티 유지보수 포크(예: vllm-windows)를 사용하세요.

Python으로 설정하기 (Set up using Python)

새 Python 환경 만들기

빠른 Python 환경 관리자 uv 사용을 권장해요.

uv venv --python 3.12 --seed --managed-python
source .venv/bin/activate

참고: vLLM은 성능을 위해 많은 CUDA 커널을 컴파일하는데, 이 과정이 다른 CUDA/PyTorch 버전과의 바이너리 비호환성을 만들 수 있어요. 그래서 vLLM은 새로운(fresh) 환경에 설치하는 걸 권장합니다. 다른 CUDA 버전을 쓰거나 기존 PyTorch 설치를 사용하고 싶다면 소스에서 빌드해야 해요.

사전 빌드 wheel (Pre-built wheels)

uv pip install vllm --torch-backend=auto
# Install vLLM with CUDA 12.9.
pip install vllm --extra-index-url https://download.pytorch.org/whl/cu129

uv는 설치된 CUDA 드라이버 버전을 검사해 --torch-backend=auto(또는 UV_TORCH_BACKEND=auto)로 적절한 PyTorch 인덱스를 자동 선택할 수 있어요. 특정 백엔드(예: cu130)를 고르려면 --torch-backend=cu130으로 설정하세요.

참고: NVIDIA Blackwell GPU(B200, GB200)는 최소 CUDA 12.8이 필요해요. vLLM 바이너리는 기본적으로 CUDA 12.9로 컴파일되며, CUDA 12.8, 13.0으로 컴파일된 바이너리도 제공됩니다.

최신 코드 설치

vLLM은 v0.5.3 이후의 모든 커밋에 대한 wheel을 https://wheels.vllm.ai/nightly에서 제공해요.

uv pip install -U vllm \
    --torch-backend=auto \
    --extra-index-url https://wheels.vllm.ai/nightly

주의: pip로 nightly 인덱스에서 설치하는 것은 지원되지 않아요. pip--extra-index-url과 기본 인덱스의 패키지를 합쳐 최신 버전만 고르기 때문이에요. uv는 extra 인덱스에 더 높은 우선순위를 줘서 개발 버전 설치가 쉬워요.

ROCm 사전 빌드 wheel은 Python 3.12 전용이에요. 다른 Python 버전(예: 3.11, 3.13)을 쓰면 설치 프로그램이 조용히 PyPI의 CUDA wheel로 폴백해서, AMD GPU에서 libcudart.so: cannot open shared object file 오류로 실패할 수 있어요. Python 3.12, ROCm 7.0, glibc >= 2.35용 최신 vLLM은 아래로 설치할 수 있어요.

uv pip install vllm --extra-index-url https://wheels.vllm.ai/rocm/ --upgrade

더 알아보기 (Learn more)