커스텀 메트릭

커스텀 메트릭 (Custom Metrics)

LLM 앱을 테스트할 때, 사전 구성된 메트릭으로는 내가 원하는 기준을 평가하지 못하는 경우가 많아요. 커스텀 메트릭은 바로 그런 상황에서 내 사용 사례에 맞는 평가 기준을 직접 정의하게 해주는 메트릭이에요. 로컬 코드로 실행할 수도, Confident AI 플랫폼에서 원격으로 실행할 수도 있어요.

출처: 문서

본문

개요

커스텀 메트릭은 LLM 앱을 테스트할 때 가장 중요한 메트릭 중 하나예요. 내 사용 사례에 특화된 기준으로 평가할 수 있게 해주기 때문이죠. 커스텀 메트릭은 두 가지 방식으로 만들고 사용할 수 있어요.

  • 로컬(Locally) — 내 머신에서 평가를 먼저 실행한 뒤 테스트 결과를 Confident AI로 보내는 방식. 코드 기반 eval에 가장 적합해요.
  • 원격(Remotely) — Confident AI에서 직접 평가를 실행하는 방식. 코드 없는 eval 워크플로우에 딱 맞아요.

로컬 평가 (Local Evals)

  • 자신의 Python 코드에서 메트릭을 완전히 제어하며 평가 실행
  • 커스텀 메트릭, DAG, 고급 평가 알고리즘 지원

적합한 대상: Python 사용자, 개발, 배포 전 워크플로우

원격 평가 (Remote Evals)

  • 사전 구성 메트릭으로 Confident AI 플랫폼에서 평가 실행
  • 모니터링, 데이터셋, 팀 협업 기능과 통합

적합한 대상: 비-Python 사용자, 프로덕션 tracing의 온라인 + 오프라인 eval

사용 가능한 커스텀 메트릭

만들 수 있는 커스텀 메트릭은 두 가지 유형이에요.

  • G-Eval: 자연어 기준으로 정의하는 LLM-as-a-judge 메트릭이에요. 코드가 필요 없고 톤, 도움됨, 도메인별 정확성처럼 미묘하고 주관적인 기준을 평가할 수 있어서, 가장 흔히 쓰이는 커스텀 메트릭 방식이에요.
  • Code-Evals: Confident AI에서 직접 Python으로 작성하는 프로그램적 메트릭이에요. 결정적 로직, 외부 API 호출, 자연어로 표현할 수 없는 복잡한 계산이 필요할 때 코드 기반 메트릭을 사용해요.

커스텀 메트릭을 로컬로 실행하면 코드 수준에서 완전히 제어할 수 있지만, Python 사용자로 제한되고 프로덕션의 온/오프라인 eval에는 사용할 수 없어요.

동작 방식

커스텀 메트릭은 단순한 워크플로우를 따라가요.

  1. 메트릭 만들기 — 로컬 코드 또는 Confident AI UI를 통해 원격으로 커스텀 메트릭을 정의해요. G-Eval은 자연어 기준을 작성하고, Code-Evals는 플랫폼에서 직접 Python 코드를 작성해요.
  2. metric collection에 추가 — 메트릭을 metric collection에 넣고 threshold(통과 최소 점수)와 strictness(실패를 얼마나 엄격히 패널티로 줄지) 같은 설정을 구성해요.
  3. 평가 실행 — 로컬 코드에서든 Confident AI 플랫폼을 통해서든 메트릭을 실행해요.
  4. 결과 확인 — Confident AI 대시보드에서 점수, reasoning, pass/fail 상태를 분석해요.

다음 단계

이제 선택지는 아셨으니, 커스텀 메트릭을 만드는 방식을 고르면 돼요.

G-Eval

자연어 기준으로 LLM-as-a-judge 메트릭을 만들어요. 미묘하고 주관적인 품질 평가에 가장 적합해요.

Code-Evals

Confident AI에서 직접 Python 코드로 결정적 로직이나 복잡한 계산을 구현해요.

더 알아보기