vllm bench sweep plot_pareto — 파레토 전선 그림
vllm bench sweep plot_pareto — 파레토 전선 그림
vllm bench sweep plot_pareto는 스윕 벤치마크 결과에서 파레토 전선(Pareto frontier)을 그리는 하위 명령입니다. 동시 사용자 수와 GPU 수 기준으로 우수한(비지배적) 결과 점들을 골라, 처리량과 지연 시간 사이의 최적 트레이드오프를 시각화합니다.
출처: 문서
본문
JSON CLI 인자
JSON CLI 인자를 넘길 때, 아래 두 방식은 서로 동등합니다.
--json-arg '{"key1": "value1", "key2": {"key3": "value2"}}'
--json-arg.key1 value1 --json-arg.key2.key3 value2
리스트 요소는 + 기호로 각각 전달할 수 있습니다.
--json-arg '{"key4": ["value3", "value4", "value5"]}'
--json-arg.key4+ value3 --json-arg.key4+='value4,value5'
핵심 옵션
| 옵션 | 기본값 | 설명 |
|---|---|---|
--user-count-var |
max_concurrency |
동시 사용자 수를 담은 결과 키. 없으면 max_concurrent_requests로 대체 |
--gpu-count-var |
None |
GPU 수를 담은 결과 키. 없으면 num_gpus/gpu_count 또는 tensor_parallel_size * pipeline_parallel_size로 대체 |
--label-by |
max_concurrency,gpu_count |
파레토 전선 점에 주석으로 붙일 쉼표 구분 필드 |
--dry-run |
False |
실제로 그리지 않고 그림 목록만 출력 |
파레토 전선은 어떤 측면에서도 다른 점보다 나쁘지 않은(better or equal) 점들의 집합이므로, "이 지연 시간에서 최대 몇 명의 사용자를 감당할 수 있는가" 같은 질문에 답할 때 유용합니다.
vllm bench sweep plot_pareto \
--user-count-var max_concurrency \
--gpu-count-var gpu_count \
--label-by "max_concurrency,gpu_count"
더 알아보기 (Learn more)
- vllm bench sweep plot — 스윕 결과 일반 그림
- vllm bench sweep serve — 서빙 스윕 실행
- vllm bench sweep serve_workload — 워크로드 스윕 실행