Weave — LLM 앱 관측·평가 플랫폼

Weave

Weave는 Weights & Biases(W&B)가 만든, LLM 애플리케이션을 추적(trace)·테스트·개선하기 위한 관측(observability) 및 평가 플랫폼이에요. 에이전트나 LLM 앱이 실제로 어떤 입력을 받고 어떤 출력을 냈는지, 지연이나 토큰 사용량 같은 지표까지 기록하면서, LLM 판정기(judge)와 커스텀 스코어러로 응답 품질을 점수로 매길 수 있어요. 덕분에 '그냥 잘 돌아가는 것'을 넘어 '얼마나 잘 돌아가는지'를 계속 확인해 나갈 수 있어요.

이 카테고리의 문서

  • 소개: Weave가 푸는 문제와 전체 그림
  • 빠른 시작: @weave.op로 함수 트레이싱 추가하기
  • Scorers: 평가 출력에 점수를 매기는 방법

출처: https://docs.wandb.ai/weave/