vLLM CLI 가이드
vLLM CLI 가이드
vllm 명령줄 도구는 vLLM 모델을 실행하고 관리하는 데 사용합니다. 먼저 도움말 메시지로 시작해 보세요:
vllm --help
사용 가능한 명령은 다음과 같습니다.
vllm {chat,complete,serve,bench,collect-env,run-batch}
출처: 문서
본문
serve
vLLM OpenAI 호환 API 서버를 시작합니다.
# 모델로 시작하기
vllm serve meta-llama/Llama-2-7b-hf
# 포트 지정
vllm serve meta-llama/Llama-2-7b-hf --port 8100
# --help 로 더 많은 옵션 확인하기
# 모든 그룹 나열
vllm serve --help=listgroup
# 특정 인자 그룹 보기
vllm serve --help=ModelConfig
# 단일 인자 보기
vllm serve --help=max-num-seqs
# 키워드로 검색
vllm serve --help=max
이때 --help=... 형태로 인자 그룹이나 개별 인자를 필터링해 볼 수 있으니, 옵션이 너무 많아 헤맬 때 유용합니다.
chat
실행 중인 API 서버를 통해 채팅 완성(chat completion)을 생성합니다.
# 인자 없이 로컬호스트 API에 바로 연결
vllm chat
# API url 지정
vllm chat --url http://{vllm-serve-host}:{vllm-serve-port}/v1
# 단일 프롬프트로 빠르게 채팅
vllm chat --quick "hi"
complete
실행 중인 API 서버를 통해 주어진 프롬프트로 텍스트 완성(text completion)을 생성합니다.
# 인자 없이 로컬호스트 API에 바로 연결
vllm complete
# API url 지정
vllm complete --url http://{vllm-serve-host}:{vllm-serve-port}/v1
# 단일 프롬프트로 빠르게 완성
vllm complete --quick "The future of AI is"
bench
지연 시간(latency), 온라인 서빙 처리량, 오프라인 추론 처리량에 대한 벤치마크 테스트를 실행합니다.
vllm bench {latency, serve, throughput}
latency
단일 배치 요청의 지연 시간을 벤치마크합니다.
vllm bench latency \
--model meta-llama/Llama-3.2-1B-Instruct \
--input-len 32 \
--output-len 1 \
--enforce-eager \
--load-format dummy
serve
온라인 서빙 처리량을 벤치마크합니다.
vllm bench serve \
--model meta-llama/Llama-3.2-1B-Instruct \
--host server-host \
--port server-port \
--random-input-len 32 \
--random-output-len 4 \
--num-prompts 5
throughput
오프라인 추론 처리량을 벤치마크합니다.
vllm bench throughput \
--model meta-llama/Llama-3.2-1B-Instruct \
--input-len 32 \
--output-len 1 \
--enforce-eager \
--load-format dummy
collect-env
환경 정보 수집을 시작합니다. 버그 리포트나 지원 요청 시 사용합니다.
vllm collect-env
run-batch
배치 프롬프트를 실행하고 결과를 파일로 기록합니다.
# 로컬 파일 사용
vllm run-batch \
-i offline_inference/openai_batch/openai_example_batch.jsonl \
-o results.jsonl \
--model meta-llama/Meta-Llama-3-8B-Instruct
# 원격 파일 사용
vllm run-batch \
-i https://raw.githubusercontent.com/vllm-project/vllm/main/examples/offline_inference/openai_batch/openai_example_batch.jsonl \
-o results.jsonl \
--model meta-llama/Meta-Llama-3-8B-Instruct
더 많은 도움말
하위 명령의 상세 옵션은 언제든 다음처럼 확인할 수 있습니다.
vllm <subcommand> --help
더 알아보기 (Learn more)
- vllm bench — 벤치마크 하위 명령 개요
- Configuration Options — vLLM 실행 시 핵심 설정 옵션
- OpenAI 호환 서버의 실제 배포 예시는 serve 페이지를 참고하세요.