LangSmith — 평가 데이터로 버전마다 비교한다
LangSmith — 평가 데이터로 버전마다 비교한다
LangSmith는 LLM 애플리케이션의 추적(tracing)과 평가(evaluation) 를 한 플랫폼에서 다루는 도구예요. 특히 '어떤 프롬프트·모델 버전이 더 나은가'를 데이터로 비교하게 해줘요.
LLM-as-judge 평가기
LangSmith는 사람이 정의한 채점 기준을 LLM이 적용하는 LLM-as-judge 평가기를 제공해요.
- 평가 스키마: 자유 텍스트 답변, 이진(합격/불합격), 점수(0~1), 비교(쌍대) 등 여러 판정 형태를 지원해요.
- 평가 데이터셋: 실제 쿼리로 평가 데이터셋을 만들고, 배포 전에 구조적 평가를 돌려 회귀를 잡아요.
- 비교 실험: 두 프롬프트·모델을 같은 평가 데이터로 대조해 어느 쪽이 우월한지 정량적으로 확인해요.
실전 흐름
프로젝트에서 실행한 트레이스를 평가 데이터셋과 연결하고, run_on_dataset 같은 API로 평가를 돌려요. 결과는 온라인 대시보드에 점수와 함께 기록돼 배포 게이트로 쓸 수 있어요.