평가에 대한 에이전트 접근(Agentic access to evaluation)
평가에 대한 에이전트 접근(Agentic access to evaluation)
AI 에이전트는 Langfuse에서 품질 이슈를 조사하고 평가 워크플로우를 운영하는 데 도움을 줄 수 있습니다. 이 문서는 에이전트가 데이터에 접근하는 다양한 방법과, 평가 관련 작업을 에이전트에게 맡기는 예시 워크플로우를 설명해요.
출처: 문서
본문
AI 에이전트는 Langfuse에서 품질 이슈를 조사하고 평가 워크플로우를 운영하는 데 도움을 줄 수 있습니다. 에이전트가 내 데이터에 접근하는 방법은 여러 가지가 있습니다.
접근 방법 선택
| 에이전트 기능 | 권장 접근 |
|---|---|
| 도구 설치와 셸 명령 실행 가능 | Langfuse Agent Skill 설치. 에이전트에게 Langfuse 워크플로우를 가르치고 Langfuse CLI 를 사용해 프로젝트 데이터를 조회·업데이트합니다. |
| 도구 설치나 셸 명령 실행 불가 | Langfuse MCP server 를 연결해 Langfuse 작업을 도구로 노출합니다. |
| 스크립트나 CI/CD 파이프라인의 일부로 실행 | Langfuse CLI 를 직접 사용하거나 Public API 를 호출합니다. |
애플리케이션 테스트의 경우 Evaluate with Datasets 로 시작한 뒤 experiments 비교 와 CI 게이트 추가 로 이어가세요. 이 예시들은 Python이나 TypeScript의 애플리케이션 함수와 그레이더를 재사용합니다.
예시 워크플로우
에이전트에게 다음을 요청해 보세요:
- 낮은 점수의 observations를 찾아 대표적인 예시를 데이터셋에 추가
- 점수 구성(score configurations) 만들기·업데이트하고 점수 기록
- 실험 결과 검토하고 회귀 식별
- 평가자(evaluators)와 평가 규칙 설정
- 인간 검토를 위한 주석 큐(annotation queues) 생성·관리
Langfuse 전반에서 작업
에이전트는 Langfuse에서 프로덕션 동작 조사 와 프롬프트 관리 도 할 수 있습니다.
관련 가이드 및 블로그 글
- Calibrate LLM-as-a-judge with the Langfuse skill — 에이전트 안내 워크플로우로 평가자를 인간 라벨과 비교하고 프롬프트를 개선
- Evaluating AI Agent Skills — Langfuse 데이터셋, tracing, 에이전트 SDK로 스킬을 반복 평가·개선하는 방법
- Headless Langfuse from your coding agent — 코딩 에이전트를 떠나지 않고 프로덕션 trace 분석, 데이터셋 구축, 평가 구성