프로덕션 트래픽 평가하기
프로덕션 트래픽 평가하기 (Evaluate Production Traffic)
이 가이드는 Langfuse에서 실시간 프로덕션 trace에 점수를 매기는 방법을 안내해요. 무엇을 평가할지 아직 모른다면 "무엇을 평가할지 고르기(Choosing what to evaluate)"부터 시작하세요. 평가기(evaluator)·점수·규칙이 어떻게 맞물리는지는 Core Concepts를 참고하세요.
출처: 문서
본문
이 가이드는 Langfuse에서 실시간 프로덕션 trace에 점수를 매기는 방법을 안내해요.
에이전트 설치 (Agentic installation)
Langfuse Agent Skill을 설치하면 코딩 에이전트가 모든 Langfuse 기능에 접근할 수 있어요.
코딩 에이전트에게 요청하기 | Cursor 플러그인 | 수동 설치
코딩 에이전트에게 github.com/langfuse/skills 저장소를 가리켜 스킬을 설치하라고 요청하고 온라인 평가로 시작하라고 지시하세요.
Install the Langfuse Agent Skill from github.com/langfuse/skills
and use it to set up online evaluation for this application
with Langfuse.
Langfuse에는 스킬을 자동으로 포함하는 Cursor 플러그인이 있어요.
그런 다음 에이전트에게 프롬프트하세요:
Set up online evaluation for this application with Langfuse.
npm으로 설치 (skills CLI):
npx skills add langfuse/skills --skill "langfuse"
특정 에이전트를 직접 지정하려면:
npx skills add langfuse/skills --skill "langfuse" --agent "<agent-id>"
또는 스킬을 수동으로 클론할 수도 있어요:
- 안정적인 위치에 저장소를 클론하세요.
git clone https://github.com/langfuse/skills.git /path/to/langfuse-skills
- 에이전트의 skills 디렉토리가 존재하는지 확인하세요.
mkdir -p /path/to/<agent-skill-root>/skills
- 스킬 폴더를 심링크하세요.
ln -s /path/to/langfuse-skills/skills/langfuse /path/to/<agent-skill-root>/skills/langfuse
그런 다음 에이전트에게 프롬프트하세요:
Set up online evaluation for this application with Langfuse.
수동 설정 (Manual setup)
이 경로는 Langfuse UI에서 온라인 평가를 설정해요. 평가기(어떻게 점수를 매길지)를 만들고, 실제 observation에서 테스트한 다음, 규칙(어떤 관찰이 점수화될지)을 첨부해요.
평가기 만들기 (Create an evaluator)
Evaluators 페이지를 열고 New evaluator를 클릭하세요. 템플릿을 선택하거나 처음부터 평가기를 만들 수 있어요.

- LLM-as-a-Judge: LLM을 사용해 점수를 매겨요. 관련성, 톤, 요청이 범위를 벗어나는지 같은 언어 이해가 필요한 특성에 사용하세요. 먼저 LLM connection이 필요해요.
- Jev as a judge: TypeSafe의 Jev decision model에 타입이 지정된 질문을 해요. 라벨, 루브릭 레벨, 또는 모든 observation에 저비용으로 붙이려는 yes/no 플래그에 사용해요. 실험적이며 TypeSafe connection이 먼저 필요해요.
- Code evaluator: Python 또는 TypeScript
evaluate함수예요. JSON 유효성, 필수 필드, 키워드 규칙 같은 결정적 검사에 사용해요.
샘플 observation에서 테스트하기 (Test on sample observations)
오른쪽에서 대표적인 프로덕션 observation으로 필터링하고, 하나를 선택한 뒤, 예상 결과와 일치할 때까지 평가기를 실행해 테스트·반복하세요.

들어오는 trace에 규칙 첨부하기 (Attach a rule to incoming traces)
평가기를 저장한 뒤, 테스트할 때 사용한 필터로부터 규칙을 만들거나, 평가기를 기존 규칙에 첨부하세요.
규칙은 어떤 observation이 점수화될지 정의해요: 필터, 샘플링 비율, 하나 이상의 평가기. 지난 7일간의 일치 볼륨을 검토하세요. LLM-as-a-Judge의 경우 예상 비용도 검토하고 필요하면 샘플링 비율을 낮추세요.
프로덕션 trace에서 점수 확인하기 (See scores on production traces)
새로 일치하는 observation이 도착하면 점수를 받아요. 점수화된 observation을 열어 값과 judge의 추론을 검사한 다음, score analytics나 커스텀 대시보드로 시간 경과에 따른 메트릭을 확인하세요.
선택한 과거 observation들에 같은 평가기를 batch evaluation으로 실행할 수도 있어요.
내 observation 레벨 평가기가 왜 실행되지 않나요?
실시간 트래픽을 점수화하는 다른 방법 (Other ways to score live traffic)
자동 평가기는 프로덕션을 지속적으로 점수화하는 가장 빠른 방법이에요. 다음 방법들도 실시간 데이터에 점수를 첨부해요:
| 원한다면... | 사용할 것 |
|---|---|
| trace 샘플을 수동으로 검토 | Scores via UI, annotation queues |
| 사용자의 thumbs up/down 또는 기타 피드백 신호 포착 | User feedback |
| 자체 파이프라인 또는 에이전트에서 점수 푸시 | Scores via API/SDK |
다음 단계 (Next steps)
- Langfuse Academy 평가 모듈을 읽어 무엇을 측정할지, 신뢰할 수 있는 평가기를 어떻게 작성할지 결정해요.
- 점수가 임계값 아래로 떨어질 때 alert를 설정해요.
- 커스텀 대시보드에서 품질을 분석해요.