LangSmith — 에이전트 평가 실행

LangSmith — 에이전트 평가 실행

LangSmith는 evaluate() 함수와 pytest 통합으로 에이전트 평가를 실행·추적하게 해줘요.

데이터셋 구성

데이터셋은 보통 input(에이전트에 넣을 메시지)과 output(기대 메시지 히스토리) 스키마로 구성해요.

평가 흐름

from langsmith import Client
client = Client()
experiment_results = client.evaluate(
    run_agent, data="your_dataset_name", evaluators=[trajectory_evaluator])

LANGSMITH_API_KEYLANGSMITH_TRACING=true를 설정하고 실행하면 LangSmith에 실험이 기록돼요.

추적과의 결합

LangSmith(LangGraph 포함)는 에이전트의 중간 단계를 트레이스로 남겨, 평가 결과와 실제 실행 경로를 함께 검토할 수 있게 해요. 그래서 멀티턴·멀티 도구 에이전트의 회귀(regression)를 잡기 좋아요.

더 알아보기