vllm bench — 벤치마크 하위 명령
vllm bench — 벤치마크 하위 명령
vllm bench는 vLLM의 다양한 성능 지표를 벤치마크하는 하위 명령입니다. 모델의 지연 시간, 온라인 서빙 처리량, 오프라인 추론 처리량, 멀티모달 프로세서 지연 시간, 스타트업 시간, 파라미터 스윕(sweep) 등을 측정할 수 있습니다.
출처: 문서
본문
개요
vllm bench는 vLLM의 벤치마크 하위 명령(subcommand)입니다. 실행할 측정 대상에 따라 다음 하위 명령 중 하나를 선택합니다.
하위 명령
| 명령 | 설명 |
|---|---|
mm-processor |
다양한 설정에서 멀티모달 프로세서의 지연 시간을 벤치마크합니다. |
latency |
단일 배치 요청의 지연 시간을 벤치마크합니다. |
serve |
온라인 서빙 처리량을 벤치마크합니다. |
startup |
vLLM 모델의 스타트업(시작) 시간을 벤치마크합니다. |
sweep |
파라미터 스윕을 위한 벤치마크를 수행합니다. |
throughput |
오프라인 추론 처리량을 벤치마크합니다. |
각 하위 명령은 vllm bench <subcommand> --help로 세부 옵션을 확인할 수 있습니다. 예를 들어 온라인 서빙 처리량을 측정하는 기본 형태는 다음과 같습니다.
vllm bench serve \
--model meta-llama/Llama-3.2-1B-Instruct \
--random-input-len 32 \
--random-output-len 4 \
--num-prompts 5
latency— 짧은 배치로 모델 지연 시간을 빠르게 확인할 때 사용합니다.serve— 실제 서버처럼 요청이 도착하는 동안의 처리량을 보고 싶을 때 사용합니다.startup— 모델 로딩과 초기화에 걸리는 시간이 궁금할 때 사용합니다.sweep— 여러 파라미터 조합을 반복 측정해 최적 설정을 찾을 때 사용합니다.
더 알아보기 (Learn more)
- vllm bench latency — 단일 배치 지연 시간 벤치마크
- vllm bench serve — 온라인 서빙 처리량 벤치마크
- vllm bench startup — 스타트업 시간 벤치마크
- vllm bench sweep — 파라미터 스윕 벤치마크
- CLI 가이드 — 전체 vllm 명령어 개요