Model Analyzer 메트릭
Model Analyzer 메트릭
Model Analyzer는 다양한 메트릭을 수집해요. 아래는 Model Analyzer로 수집할 수 있는 메트릭과, Model Analyzer를 구성하는 여러 곳에서 쓰이는 해당 메트릭 태그 목록입니다.
Perf Analyzer 메트릭
이 메트릭은 perf analyzer에서 나오며 model analyzer가 파싱·처리합니다. 자세한 내용은 perf analyzer 문서를 참고하세요.
perf_throughput: perf analyzer가 측정한 초당 추론 수.perf_latency_avg: perf analyzer가 측정한 평균 지연시간.perf_latency_p90: perf analyzer가 측정한 p90 지연시간.perf_latency_p95: perf analyzer가 측정한 p95 지연시간.perf_latency_p99: perf analyzer가 측정한 p99 지연시간.perf_client_response_wait: 추론 요청이 전송된 후 서버의 응답을 기다린 시간.perf_client_send_recv: 클라이언트가 요청을 보내는 데 걸린 시간과 응답을 받는 데 걸린 시간의 합(네트워크 RTT 미포함).perf_server_queue: 요청이 모델 인스턴스를 기다리며 추론 스케줄 큐에 보낸 평균 시간.perf_server_compute_input: 입력 버퍼에서 GPU로 데이터를 복사하는 데 걸린 시간.perf_server_compute_infer: 실제 추론을 수행하는 데 쓴 평균 시간.perf_server_compute_output: GPU에서 출력 버퍼로 데이터를 복사하는 데 걸린 시간.
GPU 메트릭
이 메트릭은 tritonserver가 수집해요. perf analyzer 실행 중 고정된 구간마다 각 GPU에 기록되고, 실행의 모든 레코드에 걸쳐 집계됩니다.
gpu_used_memory: GPU가 사용한 최대 메모리.gpu_free_memory: GPU에서 사용 가능한 최대 메모리.gpu_utilization: GPU의 평균 사용률.gpu_power_usage: GPU의 평균 전력 사용량.
CPU 메트릭
이 메트릭은 psutil 또는 docker stats로 수집되며, perf analyzer 실행 중 고정된 구간마다 기록되고 집계돼요.
cpu_used_ram: 모든 CPU가 사용한 총 메모리.cpu_available_ram: 사용 가능한 총 CPU 메모리.
경고: CPU 메트릭 수집은 처리량·지연시간 같은 모델 추론 메트릭에 영향을 줄 수 있어요. 기본적으로 CPU 메트릭은 수집되지 않습니다. CPU 메트릭을 수집하려면 collect_cpu_metrics 플래그를 true로 설정하세요. 자세한 내용은 Model Analyzer 구성하기를 참고합니다.
출력 헤더용 추가 태그
이 태그들은 server_output_fields, inference_output_fields, gpu_output_fields 같은 옵션에서 출력 테이블에 표시할 파라미터(메트릭뿐 아니라)를 제어하는 데 쓰여요.
model_name: 모델 이름.batch_size: 측정에 사용된 배치 크기.concurrency: 측정에 사용된 클라이언트 요청 동시성.model_config_path: 모델 설정 경로.instance_group: 인스턴스 수/유형.satisfies_constraints: 이 측정이 제약을 만족하면Yes, 그렇지 않으면No.gpu_uuid: 이 측정이 이뤄진 GPU의 UUID.