vllm bench startup — 스타트업 시간 벤치마크

vllm bench startup — 스타트업 시간 벤치마크

vllm bench startup은 vLLM 모델의 스타트업(시작) 시간을 벤치마크하는 하위 명령입니다. 콜드 스타트(cold start)와 웜 스타트(warm start)를 각각 여러 번 반복 측정해, 모델 로딩과 초기화에 걸리는 시간을 정량화합니다.

출처: 문서

본문

JSON CLI 인자

JSON CLI 인자를 넘길 때, 아래 두 방식은 서로 동등합니다.

--json-arg '{"key1": "value1", "key2": {"key3": "value2"}}'
--json-arg.key1 value1 --json-arg.key2.key3 value2

리스트 요소는 + 기호로 각각 전달할 수 있습니다.

--json-arg '{"key4": ["value3", "value4", "value5"]}'
--json-arg.key4+ value3 --json-arg.key4+='value4,value5'

핵심 옵션

옵션 기본값 설명
--num-iters-cold 3 콜드 스타트업 반복 횟수
--num-iters-warmup 1 웜 스타트업 측정 전 워밍업 반복 횟수
--num-iters-warm 3 웜 스타트업 반복 횟수
--output-json None 스타트업 시간 결과를 JSON으로 저장할 경로
--disable-log-stats False 통계 로깅 비활성화
--aggregate-engine-logging False 데이터 병렬(DP) 사용 시 엔진별이 아닌 집계 통계 로깅
--fail-on-environ-validation False 환경 검증 실패 시 엔진이 오류 발생
--shutdown-timeout 0 종료 타임아웃(초). 0 = 즉시 중단, >0 = 대기
  • 콜드 스타트업(cold startup) : 캐시 없이 처음부터 엔진을 초기화하는 시간입니다.
  • 웜 스타트업(warm startup) : 미리 예열된 상태에서 엔진을 다시 시작하는 시간입니다.
  • 스타트업 시간에는 모델 가중치 로딩, 토크나이저 초기화, GPU 메모리 예약, 추론 엔진 초기화 등이 포함됩니다.
vllm bench startup \
    --model meta-llama/Llama-3-8B-Instruct \
    --output-json startup_results.json \
    --num-iters-cold 3 \
    --num-iters-warm 3

ModelConfig 등 각 인자 그룹의 전체 옵션은 vllm bench startup --help로 확인할 수 있습니다.

더 알아보기 (Learn more)