평가에 대한 에이전트 접근(Agentic access to evaluation)

평가에 대한 에이전트 접근(Agentic access to evaluation)

AI 에이전트는 Langfuse에서 품질 이슈를 조사하고 평가 워크플로우를 운영하는 데 도움을 줄 수 있습니다. 이 문서는 에이전트가 데이터에 접근하는 다양한 방법과, 평가 관련 작업을 에이전트에게 맡기는 예시 워크플로우를 설명해요.

출처: 문서

본문

AI 에이전트는 Langfuse에서 품질 이슈를 조사하고 평가 워크플로우를 운영하는 데 도움을 줄 수 있습니다. 에이전트가 내 데이터에 접근하는 방법은 여러 가지가 있습니다.

접근 방법 선택

에이전트 기능 권장 접근
도구 설치와 셸 명령 실행 가능 Langfuse Agent Skill 설치. 에이전트에게 Langfuse 워크플로우를 가르치고 Langfuse CLI 를 사용해 프로젝트 데이터를 조회·업데이트합니다.
도구 설치나 셸 명령 실행 불가 Langfuse MCP server 를 연결해 Langfuse 작업을 도구로 노출합니다.
스크립트나 CI/CD 파이프라인의 일부로 실행 Langfuse CLI 를 직접 사용하거나 Public API 를 호출합니다.

애플리케이션 테스트의 경우 Evaluate with Datasets 로 시작한 뒤 experiments 비교CI 게이트 추가 로 이어가세요. 이 예시들은 Python이나 TypeScript의 애플리케이션 함수와 그레이더를 재사용합니다.

예시 워크플로우

에이전트에게 다음을 요청해 보세요:

  • 낮은 점수의 observations를 찾아 대표적인 예시를 데이터셋에 추가
  • 점수 구성(score configurations) 만들기·업데이트하고 점수 기록
  • 실험 결과 검토하고 회귀 식별
  • 평가자(evaluators)와 평가 규칙 설정
  • 인간 검토를 위한 주석 큐(annotation queues) 생성·관리

Langfuse 전반에서 작업

에이전트는 Langfuse에서 프로덕션 동작 조사프롬프트 관리 도 할 수 있습니다.

관련 가이드 및 블로그 글

더 알아보기 (Learn more)