vllm bench sweep plot_pareto — 파레토 전선 그림

vllm bench sweep plot_pareto — 파레토 전선 그림

vllm bench sweep plot_pareto는 스윕 벤치마크 결과에서 파레토 전선(Pareto frontier)을 그리는 하위 명령입니다. 동시 사용자 수와 GPU 수 기준으로 우수한(비지배적) 결과 점들을 골라, 처리량과 지연 시간 사이의 최적 트레이드오프를 시각화합니다.

출처: 문서

본문

JSON CLI 인자

JSON CLI 인자를 넘길 때, 아래 두 방식은 서로 동등합니다.

--json-arg '{"key1": "value1", "key2": {"key3": "value2"}}'
--json-arg.key1 value1 --json-arg.key2.key3 value2

리스트 요소는 + 기호로 각각 전달할 수 있습니다.

--json-arg '{"key4": ["value3", "value4", "value5"]}'
--json-arg.key4+ value3 --json-arg.key4+='value4,value5'

핵심 옵션

옵션 기본값 설명
--user-count-var max_concurrency 동시 사용자 수를 담은 결과 키. 없으면 max_concurrent_requests로 대체
--gpu-count-var None GPU 수를 담은 결과 키. 없으면 num_gpus/gpu_count 또는 tensor_parallel_size * pipeline_parallel_size로 대체
--label-by max_concurrency,gpu_count 파레토 전선 점에 주석으로 붙일 쉼표 구분 필드
--dry-run False 실제로 그리지 않고 그림 목록만 출력

파레토 전선은 어떤 측면에서도 다른 점보다 나쁘지 않은(better or equal) 점들의 집합이므로, "이 지연 시간에서 최대 몇 명의 사용자를 감당할 수 있는가" 같은 질문에 답할 때 유용합니다.

vllm bench sweep plot_pareto \
    --user-count-var max_concurrency \
    --gpu-count-var gpu_count \
    --label-by "max_concurrency,gpu_count"

더 알아보기 (Learn more)