사용량 통계 수집
사용량 통계 수집 (Usage Stats Collection)
vLLM은 어떤 하드웨어·모델 구성이 널리 쓰이는지 엔지니어링 팀이 더 잘 이해하도록 기본적으로 익명 사용 데이터를 수집합니다. 이 데이터는 가장 흔한 워크로드에 우선순위를 두는 데 도움이 되며, 투명하고 민감한 정보를 포함하지 않습니다.
출처: 문서
본문
vLLM은 어떤 하드웨어·모델 구성이 널리 사용되는지 엔지니어링 팀이 더 잘 이해하도록 기본적으로 익명 사용 데이터를 수집합니다. 이 데이터는 가장 흔한 워크로드에 우선순위를 두게 해 줍니다. 수집된 데이터는 투명하며 민감한 정보를 포함하지 않습니다.
데이터의 일부는 정제·집계 후 커뮤니티 이익을 위해 공개됩니다. 예를 들어 2024 사용 보고서를 여기에서 볼 수 있습니다.
어떤 데이터가 수집되나요? (What data is collected?)
최신 vLLM 버전이 수집하는 데이터 목록은 여기에서 확인할 수 있습니다: vllm/usage/usage_lib.py
v0.4.0 기준 예시:
{
"uuid": "fbe880e9-084d-4cab-a395-8984c50f1109",
"provider": "GCP",
"num_cpu": 24,
"cpu_type": "Intel(R) Xeon(R) CPU @ 2.20GHz",
"cpu_family_model_stepping": "6,85,7",
"total_memory": 101261135872,
"architecture": "x86_64",
"platform": "Linux-5.10.0-28-cloud-amd64-x86_64-with-glibc2.31",
"gpu_count": 2,
"gpu_type": "NVIDIA L4",
"gpu_memory_per_device": 23580639232,
"model_architecture": "OPTForCausalLM",
"vllm_version": "0.3.2+cu123",
"context": "LLM_CLASS",
"log_time": 1711663373492490000,
"source": "production",
"dtype": "torch.float16",
"tensor_parallel_size": 1,
"block_size": 16,
"gpu_memory_utilization": 0.9,
"quantization": null,
"kv_cache_dtype": "auto",
"enable_lora": false,
"enable_prefix_caching": false,
"enforce_eager": false,
"disable_custom_all_reduce": true
}
수집된 데이터는 다음 명령으로 미리 볼 수 있습니다:
tail ~/.config/vllm/usage_stats.json
옵트아웃 (Opting out)
VLLM_NO_USAGE_STATS 또는 DO_NOT_TRACK 환경 변수를 설정하거나, ~/.config/vllm/do_not_track 파일을 만들어 사용량 통계 수집을 거부할 수 있습니다:
# Any of the following methods can disable usage stats collection
export VLLM_NO_USAGE_STATS=1
export DO_NOT_TRACK=1
mkdir -p ~/.config/vllm && touch ~/.config/vllm/do_not_track