Langfuse LLM 평가 개요 (Evaluation Overview)
Langfuse LLM 평가 개요 (Evaluation Overview)
LLM 애플리케이션이 제대로 작동하는지 확인하려면 "대충 봤을 때 괜찮아 보인다"보다 반복 가능한 기준이 필요해요. 평가(Evals)는 애플리케이션의 동작에 반복 가능한 검사를 걸어서, 추측을 데이터로 바꾸고 변경 사항을 배포하기 전에 회귀(regression)를 잡아주는 역할을 해요. Langfuse는 평가가 어디서 일어나든—운영 중 라이브 트레이스든, 배포 전 데이터셋이든—모든 평가 결과를 한곳에 모아줘요.
평가는 언제, 어디서 일어나나요
평가는 AI 엔지니어링 루프의 대부분을 관통해요. 운영 중 라이브 트레이스에 점수를 매기고, 흥미로운 예시를 데이터셋으로 만들고, 변경 사항을 비교하는 실험을 돌리며, 결과를 수동 또는 자동 평가자로 판정하죠. 이렇게 온라인(라이브 프로덕션 트레이스)과 오프라인(변경 배포 전) 두 시점에서 모두 일어나요.
- 라이브 유입 트레이스를 평가해 프로덕션 데이터의 품질을 측정하고 시간에 따른 추세를 추적할 수 있어요.
- 사전 정의된 데이터셋 위에서 기존 애플리케이션을 평가해 변경 사항이 프로덕션에 나가도 될지 확인할 수 있어요.
평가자(evaluator)·점수(score)·데이터셋·실험이 어떻게 맞물리는지는 핵심 개념 페이지에서 더 자세히 볼 수 있어요.
어떤 평가 방법이 있나요
Langfuse는 다양한 평가 방법을 지원해서, 어떤 상황에서도 유연하게 대응할 수 있어요.
| 하고 싶은 일 | 쓸 수 있는 Langfuse 기능 |
|---|---|
| 트레이스를 수동으로 검토·평가 | Annotation Queues, Scores via UI |
| 최종 사용자 피드백 수집 | User Feedback |
| 트레이스에 열린 형식 메모 남기기 | Text scores, Annotation Queues |
| 재사용 가능한 테스트 케이스 구축 | Datasets |
| 프롬프트·모델·코드 변경 나란히 비교 | Experiments via UI / SDK / OpenTelemetry |
| 회귀 시 배포 차단 | CI/CD experiments |
| 결정적 검사 실행 | Code Evaluators |
| 라이브 프로덕션 트레이스 자동 점수화 | LLM-as-a-Judge, Scores via API/SDK |
| 점수 추세를 시간에 따라 보기 | Score Analytics, custom dashboards |
CI에서 회귀 잡기
배포 전에 회귀를 잡으려면 CI에서 실험을 돌려요. pull_request 워크플로우에 langfuse/experiment-action GitHub Action을 추가하고, 실험 스크립트에서 점수가 임계값을 위반하면 RegressionError를 던지게 하면 액션이 해당 잡을 실패 처리해요. Langfuse Cloud와 자체 호스팅 모두에서 동작해요.