vllm bench startup — 스타트업 시간 벤치마크
vllm bench startup — 스타트업 시간 벤치마크
vllm bench startup은 vLLM 모델의 스타트업(시작) 시간을 벤치마크하는 하위 명령입니다. 콜드 스타트(cold start)와 웜 스타트(warm start)를 각각 여러 번 반복 측정해, 모델 로딩과 초기화에 걸리는 시간을 정량화합니다.
출처: 문서
본문
JSON CLI 인자
JSON CLI 인자를 넘길 때, 아래 두 방식은 서로 동등합니다.
--json-arg '{"key1": "value1", "key2": {"key3": "value2"}}'
--json-arg.key1 value1 --json-arg.key2.key3 value2
리스트 요소는 + 기호로 각각 전달할 수 있습니다.
--json-arg '{"key4": ["value3", "value4", "value5"]}'
--json-arg.key4+ value3 --json-arg.key4+='value4,value5'
핵심 옵션
| 옵션 | 기본값 | 설명 |
|---|---|---|
--num-iters-cold |
3 |
콜드 스타트업 반복 횟수 |
--num-iters-warmup |
1 |
웜 스타트업 측정 전 워밍업 반복 횟수 |
--num-iters-warm |
3 |
웜 스타트업 반복 횟수 |
--output-json |
None |
스타트업 시간 결과를 JSON으로 저장할 경로 |
--disable-log-stats |
False |
통계 로깅 비활성화 |
--aggregate-engine-logging |
False |
데이터 병렬(DP) 사용 시 엔진별이 아닌 집계 통계 로깅 |
--fail-on-environ-validation |
False |
환경 검증 실패 시 엔진이 오류 발생 |
--shutdown-timeout |
0 |
종료 타임아웃(초). 0 = 즉시 중단, >0 = 대기 |
- 콜드 스타트업(cold startup) : 캐시 없이 처음부터 엔진을 초기화하는 시간입니다.
- 웜 스타트업(warm startup) : 미리 예열된 상태에서 엔진을 다시 시작하는 시간입니다.
- 스타트업 시간에는 모델 가중치 로딩, 토크나이저 초기화, GPU 메모리 예약, 추론 엔진 초기화 등이 포함됩니다.
vllm bench startup \
--model meta-llama/Llama-3-8B-Instruct \
--output-json startup_results.json \
--num-iters-cold 3 \
--num-iters-warm 3
ModelConfig 등 각 인자 그룹의 전체 옵션은 vllm bench startup --help로 확인할 수 있습니다.
더 알아보기 (Learn more)
- vllm bench serve — 온라인 서빙 처리량 벤치마크
- vllm bench latency — 지연 시간 벤치마크
- vllm bench — 벤치마크 하위 명령 개요