TruLens 평가 — 피드백 함수와 LLM judge
TruLens 평가
TruLens의 평가 핵심은 **피드백 함수(Feedback Functions)**예요. 전통 ML에서는 정답(ground truth)이 있어 정확도를 재지만, LLM 앱은 ground truth가 없을 때가 많아요. 그래서 피드백 함수로 프로그래매틱하게 평가 메트릭을 계산해요.
왜 피드백 함수인가요
일반 벤치마크는 당신의 앱·당신의 데이터·당신의 사용자를 기준으로 측정하지 않아요. 피드백 함수는 당신의 앱을, 당신의 데이터에서, 당신의 사용자에 대해 측정하므로 훨씬 실용적이에요.
구성: 프로바이더 + 구현
TruLens는 피드백 함수를 두 조각의 결합으로 만들어요.
- Feedback provider(피드백 프로바이더) — 더 일반적인 모델
- Feedback implementation(피드백 구현) — 특정 평가 태스크에 맞춘 프롬프트와 커스텀 로직
이 구성은 **조합 가능(composable)**하고 **확장 가능(extensible)**해요. 어떤 프로바이더든 어떤 구현과도 조합할 수 있고, 커스텀 구현으로 프로바이더를 확장할 수도 있어요.
LLM judge 개발
프로바이더를 고르는 것만으로는 judge 품질이 보장되지 않아요. 루브릭·지시·예시·모델·점수 임계값을 바꾼 뒤 human labels와 대조해 검증해야 해요. 예를 들어 긴 컨텍스트의 고위험 평가는 더 비싼 최신 모델을, 저위험·대량 시나리오는 작고 저렴한 모델을 쓸 수 있어요.