Langfuse LLM 평가 개요 (Evaluation Overview)

Langfuse LLM 평가 개요 (Evaluation Overview)

LLM 애플리케이션이 제대로 작동하는지 확인하려면 "대충 봤을 때 괜찮아 보인다"보다 반복 가능한 기준이 필요해요. 평가(Evals)는 애플리케이션의 동작에 반복 가능한 검사를 걸어서, 추측을 데이터로 바꾸고 변경 사항을 배포하기 전에 회귀(regression)를 잡아주는 역할을 해요. Langfuse는 평가가 어디서 일어나든—운영 중 라이브 트레이스든, 배포 전 데이터셋이든—모든 평가 결과를 한곳에 모아줘요.

출처: Langfuse Evaluation Overview

평가는 언제, 어디서 일어나나요

평가는 AI 엔지니어링 루프의 대부분을 관통해요. 운영 중 라이브 트레이스에 점수를 매기고, 흥미로운 예시를 데이터셋으로 만들고, 변경 사항을 비교하는 실험을 돌리며, 결과를 수동 또는 자동 평가자로 판정하죠. 이렇게 온라인(라이브 프로덕션 트레이스)과 오프라인(변경 배포 전) 두 시점에서 모두 일어나요.

평가자(evaluator)·점수(score)·데이터셋·실험이 어떻게 맞물리는지는 핵심 개념 페이지에서 더 자세히 볼 수 있어요.

어떤 평가 방법이 있나요

Langfuse는 다양한 평가 방법을 지원해서, 어떤 상황에서도 유연하게 대응할 수 있어요.

하고 싶은 일 쓸 수 있는 Langfuse 기능
트레이스를 수동으로 검토·평가 Annotation Queues, Scores via UI
최종 사용자 피드백 수집 User Feedback
트레이스에 열린 형식 메모 남기기 Text scores, Annotation Queues
재사용 가능한 테스트 케이스 구축 Datasets
프롬프트·모델·코드 변경 나란히 비교 Experiments via UI / SDK / OpenTelemetry
회귀 시 배포 차단 CI/CD experiments
결정적 검사 실행 Code Evaluators
라이브 프로덕션 트레이스 자동 점수화 LLM-as-a-Judge, Scores via API/SDK
점수 추세를 시간에 따라 보기 Score Analytics, custom dashboards

CI에서 회귀 잡기

배포 전에 회귀를 잡으려면 CI에서 실험을 돌려요. pull_request 워크플로우에 langfuse/experiment-action GitHub Action을 추가하고, 실험 스크립트에서 점수가 임계값을 위반하면 RegressionError를 던지게 하면 액션이 해당 잡을 실패 처리해요. Langfuse Cloud와 자체 호스팅 모두에서 동작해요.

더 알아보기 (Learn more)