Model Analyzer 메트릭

Model Analyzer 메트릭

Model Analyzer는 다양한 메트릭을 수집해요. 아래는 Model Analyzer로 수집할 수 있는 메트릭과, Model Analyzer를 구성하는 여러 곳에서 쓰이는 해당 메트릭 태그 목록입니다.

Perf Analyzer 메트릭

이 메트릭은 perf analyzer에서 나오며 model analyzer가 파싱·처리합니다. 자세한 내용은 perf analyzer 문서를 참고하세요.

  • perf_throughput: perf analyzer가 측정한 초당 추론 수.
  • perf_latency_avg: perf analyzer가 측정한 평균 지연시간.
  • perf_latency_p90: perf analyzer가 측정한 p90 지연시간.
  • perf_latency_p95: perf analyzer가 측정한 p95 지연시간.
  • perf_latency_p99: perf analyzer가 측정한 p99 지연시간.
  • perf_client_response_wait: 추론 요청이 전송된 후 서버의 응답을 기다린 시간.
  • perf_client_send_recv: 클라이언트가 요청을 보내는 데 걸린 시간과 응답을 받는 데 걸린 시간의 합(네트워크 RTT 미포함).
  • perf_server_queue: 요청이 모델 인스턴스를 기다리며 추론 스케줄 큐에 보낸 평균 시간.
  • perf_server_compute_input: 입력 버퍼에서 GPU로 데이터를 복사하는 데 걸린 시간.
  • perf_server_compute_infer: 실제 추론을 수행하는 데 쓴 평균 시간.
  • perf_server_compute_output: GPU에서 출력 버퍼로 데이터를 복사하는 데 걸린 시간.

GPU 메트릭

이 메트릭은 tritonserver가 수집해요. perf analyzer 실행 중 고정된 구간마다 각 GPU에 기록되고, 실행의 모든 레코드에 걸쳐 집계됩니다.

  • gpu_used_memory: GPU가 사용한 최대 메모리.
  • gpu_free_memory: GPU에서 사용 가능한 최대 메모리.
  • gpu_utilization: GPU의 평균 사용률.
  • gpu_power_usage: GPU의 평균 전력 사용량.

CPU 메트릭

이 메트릭은 psutil 또는 docker stats로 수집되며, perf analyzer 실행 중 고정된 구간마다 기록되고 집계돼요.

  • cpu_used_ram: 모든 CPU가 사용한 총 메모리.
  • cpu_available_ram: 사용 가능한 총 CPU 메모리.

경고: CPU 메트릭 수집은 처리량·지연시간 같은 모델 추론 메트릭에 영향을 줄 수 있어요. 기본적으로 CPU 메트릭은 수집되지 않습니다. CPU 메트릭을 수집하려면 collect_cpu_metrics 플래그를 true로 설정하세요. 자세한 내용은 Model Analyzer 구성하기를 참고합니다.

출력 헤더용 추가 태그

이 태그들은 server_output_fields, inference_output_fields, gpu_output_fields 같은 옵션에서 출력 테이블에 표시할 파라미터(메트릭뿐 아니라)를 제어하는 데 쓰여요.

  • model_name: 모델 이름.
  • batch_size: 측정에 사용된 배치 크기.
  • concurrency: 측정에 사용된 클라이언트 요청 동시성.
  • model_config_path: 모델 설정 경로.
  • instance_group: 인스턴스 수/유형.
  • satisfies_constraints: 이 측정이 제약을 만족하면 Yes, 그렇지 않으면 No.
  • gpu_uuid: 이 측정이 이뤄진 GPU의 UUID.

출처: 공식 문서 - Model Analyzer Metrics

더 알아보기 (Learn more)