vLLM CLI 가이드

vLLM CLI 가이드

vllm 명령줄 도구는 vLLM 모델을 실행하고 관리하는 데 사용합니다. 먼저 도움말 메시지로 시작해 보세요:

vllm --help

사용 가능한 명령은 다음과 같습니다.

vllm {chat,complete,serve,bench,collect-env,run-batch}

출처: 문서

본문

serve

vLLM OpenAI 호환 API 서버를 시작합니다.

# 모델로 시작하기
vllm serve meta-llama/Llama-2-7b-hf

# 포트 지정
vllm serve meta-llama/Llama-2-7b-hf --port 8100

# --help 로 더 많은 옵션 확인하기
# 모든 그룹 나열
vllm serve --help=listgroup

# 특정 인자 그룹 보기
vllm serve --help=ModelConfig

# 단일 인자 보기
vllm serve --help=max-num-seqs

# 키워드로 검색
vllm serve --help=max

이때 --help=... 형태로 인자 그룹이나 개별 인자를 필터링해 볼 수 있으니, 옵션이 너무 많아 헤맬 때 유용합니다.

chat

실행 중인 API 서버를 통해 채팅 완성(chat completion)을 생성합니다.

# 인자 없이 로컬호스트 API에 바로 연결
vllm chat

# API url 지정
vllm chat --url http://{vllm-serve-host}:{vllm-serve-port}/v1

# 단일 프롬프트로 빠르게 채팅
vllm chat --quick "hi"

complete

실행 중인 API 서버를 통해 주어진 프롬프트로 텍스트 완성(text completion)을 생성합니다.

# 인자 없이 로컬호스트 API에 바로 연결
vllm complete

# API url 지정
vllm complete --url http://{vllm-serve-host}:{vllm-serve-port}/v1

# 단일 프롬프트로 빠르게 완성
vllm complete --quick "The future of AI is"

bench

지연 시간(latency), 온라인 서빙 처리량, 오프라인 추론 처리량에 대한 벤치마크 테스트를 실행합니다.

vllm bench {latency, serve, throughput}

latency

단일 배치 요청의 지연 시간을 벤치마크합니다.

vllm bench latency \
    --model meta-llama/Llama-3.2-1B-Instruct \
    --input-len 32 \
    --output-len 1 \
    --enforce-eager \
    --load-format dummy

serve

온라인 서빙 처리량을 벤치마크합니다.

vllm bench serve \
    --model meta-llama/Llama-3.2-1B-Instruct \
    --host server-host \
    --port server-port \
    --random-input-len 32 \
    --random-output-len 4  \
    --num-prompts  5

throughput

오프라인 추론 처리량을 벤치마크합니다.

vllm bench throughput \
    --model meta-llama/Llama-3.2-1B-Instruct \
    --input-len 32 \
    --output-len 1 \
    --enforce-eager \
    --load-format dummy

collect-env

환경 정보 수집을 시작합니다. 버그 리포트나 지원 요청 시 사용합니다.

vllm collect-env

run-batch

배치 프롬프트를 실행하고 결과를 파일로 기록합니다.

# 로컬 파일 사용
vllm run-batch \
    -i offline_inference/openai_batch/openai_example_batch.jsonl \
    -o results.jsonl \
    --model meta-llama/Meta-Llama-3-8B-Instruct

# 원격 파일 사용
vllm run-batch \
    -i https://raw.githubusercontent.com/vllm-project/vllm/main/examples/offline_inference/openai_batch/openai_example_batch.jsonl \
    -o results.jsonl \
    --model meta-llama/Meta-Llama-3-8B-Instruct

더 많은 도움말

하위 명령의 상세 옵션은 언제든 다음처럼 확인할 수 있습니다.

vllm <subcommand> --help

더 알아보기 (Learn more)

  • vllm bench — 벤치마크 하위 명령 개요
  • Configuration Options — vLLM 실행 시 핵심 설정 옵션
  • OpenAI 호환 서버의 실제 배포 예시는 serve 페이지를 참고하세요.