커스텀 메트릭
커스텀 메트릭 (Custom Metrics)
LLM 앱을 테스트할 때, 사전 구성된 메트릭으로는 내가 원하는 기준을 평가하지 못하는 경우가 많아요. 커스텀 메트릭은 바로 그런 상황에서 내 사용 사례에 맞는 평가 기준을 직접 정의하게 해주는 메트릭이에요. 로컬 코드로 실행할 수도, Confident AI 플랫폼에서 원격으로 실행할 수도 있어요.
출처: 문서
본문
개요
커스텀 메트릭은 LLM 앱을 테스트할 때 가장 중요한 메트릭 중 하나예요. 내 사용 사례에 특화된 기준으로 평가할 수 있게 해주기 때문이죠. 커스텀 메트릭은 두 가지 방식으로 만들고 사용할 수 있어요.
- 로컬(Locally) — 내 머신에서 평가를 먼저 실행한 뒤 테스트 결과를 Confident AI로 보내는 방식. 코드 기반 eval에 가장 적합해요.
- 원격(Remotely) — Confident AI에서 직접 평가를 실행하는 방식. 코드 없는 eval 워크플로우에 딱 맞아요.
로컬 평가 (Local Evals)
- 자신의 Python 코드에서 메트릭을 완전히 제어하며 평가 실행
- 커스텀 메트릭, DAG, 고급 평가 알고리즘 지원
적합한 대상: Python 사용자, 개발, 배포 전 워크플로우
원격 평가 (Remote Evals)
- 사전 구성 메트릭으로 Confident AI 플랫폼에서 평가 실행
- 모니터링, 데이터셋, 팀 협업 기능과 통합
적합한 대상: 비-Python 사용자, 프로덕션 tracing의 온라인 + 오프라인 eval
사용 가능한 커스텀 메트릭
만들 수 있는 커스텀 메트릭은 두 가지 유형이에요.
- G-Eval: 자연어 기준으로 정의하는 LLM-as-a-judge 메트릭이에요. 코드가 필요 없고 톤, 도움됨, 도메인별 정확성처럼 미묘하고 주관적인 기준을 평가할 수 있어서, 가장 흔히 쓰이는 커스텀 메트릭 방식이에요.
- Code-Evals: Confident AI에서 직접 Python으로 작성하는 프로그램적 메트릭이에요. 결정적 로직, 외부 API 호출, 자연어로 표현할 수 없는 복잡한 계산이 필요할 때 코드 기반 메트릭을 사용해요.
커스텀 메트릭을 로컬로 실행하면 코드 수준에서 완전히 제어할 수 있지만, Python 사용자로 제한되고 프로덕션의 온/오프라인 eval에는 사용할 수 없어요.
동작 방식
커스텀 메트릭은 단순한 워크플로우를 따라가요.
- 메트릭 만들기 — 로컬 코드 또는 Confident AI UI를 통해 원격으로 커스텀 메트릭을 정의해요. G-Eval은 자연어 기준을 작성하고, Code-Evals는 플랫폼에서 직접 Python 코드를 작성해요.
- metric collection에 추가 — 메트릭을 metric collection에 넣고 threshold(통과 최소 점수)와 strictness(실패를 얼마나 엄격히 패널티로 줄지) 같은 설정을 구성해요.
- 평가 실행 — 로컬 코드에서든 Confident AI 플랫폼을 통해서든 메트릭을 실행해요.
- 결과 확인 — Confident AI 대시보드에서 점수, reasoning, pass/fail 상태를 분석해요.
다음 단계
이제 선택지는 아셨으니, 커스텀 메트릭을 만드는 방식을 고르면 돼요.
G-Eval
자연어 기준으로 LLM-as-a-judge 메트릭을 만들어요. 미묘하고 주관적인 품질 평가에 가장 적합해요.
Code-Evals
Confident AI에서 직접 Python 코드로 결정적 로직이나 복잡한 계산을 구현해요.
더 알아보기
- G-Eval — 자연어 기준 커스텀 메트릭
- Code-Evals — 코드 기반 커스텀 메트릭
- Metric Collections — 원격 평가를 위한 메트릭 묶기