복합(Composite) 평가기 만들기

복합(Composite) 평가기 만들기 (UI)

복합 평가기는 여러 평가기 점수를 단일 점수로 결합하는 방법이에요. 애플리케이션의 여러 측면을 평가하고 결과를 단일 결과로 합치고 싶을 때 유용합니다. 이 가이드는 LangSmith UI복합 평가기를 정의하는 방법을 보여줍니다.

출처: 문서

참고: SDK로 프로그래매틱하게 복합 평가기를 만들려면 복합 평가기 만들기 방법 (SDK)을 참고하세요.

본문

복합 평가기는 여러 평가기 점수를 단일 점수로 결합하는 방법입니다. 애플리케이션의 여러 측면을 평가하고 결과를 단일 결과로 결합하려는 경우 유용합니다.

이 가이드는 LangSmith UI를 사용해 복합 평가기를 정의하는 방법을 보여줍니다.

복합 평가기 만들기

트레이싱 프로젝트(온라인 평가용) 또는 데이터셋(오프라인 평가용)에서 복합 평가기를 만들 수 있습니다. UI의 복합 평가기로 여러 평가기 점수의 가중 평균 또는 가중 합을 구성 가능한 가중치로 계산할 수 있습니다.

LangSmith UI showing an LLM call trace called ChatOpenAI

1. 트레이싱 프로젝트 또는 데이터셋으로 이동

복합 평가기 구성을 시작하려면 Tracing Projects 또는 Dataset & Experiments 탭으로 이동해 프로젝트나 데이터셋을 선택합니다.

  • 트레이싱 프로젝트 안에서: + New > Evaluator > Composite score
  • 데이터셋 안에서: + Evaluator > Composite score

2. 복합 평가기 구성

  1. 평가기에 이름을 지정합니다.
  2. Average 또는 Sum 집계 방법을 선택합니다.
    • Average: ∑(weight*score) / ∑(weight).
    • Sum: ∑(weight*score).
  3. 복합 점수에 포함할 피드백 키를 추가합니다.
  4. 피드백 키의 가중치를 추가합니다. 기본적으로 각 피드백 키의 가중치는 동일합니다. 특정 피드백 키의 중요도를 높이거나 낮추도록 가중치를 조정합니다.
  5. Create를 클릭해 평가기를 저장합니다.

팁: 복합 점수의 가중치를 조정해야 한다면 평가기 생성 후 업데이트할 수 있습니다. 평가기가 구성된 모든 런에 대해 결과 점수가 업데이트됩니다.

3. 복합 평가기 결과 보기

복합 점수는 단일 평가기의 피드백과 마찬가지로 런에 feedback으로 연결됩니다. 보는 방법은 평가가 실행된 위치에 따라 다릅니다:

트레이싱 프로젝트에서:

  • 복합 점수는 런의 피드백으로 나타납니다.
  • 복합 점수가 있거나 특정 임계값을 충족하는 런을 필터링합니다.
  • 차트를 만들어 복합 점수의 시간에 따른 추세를 시각화합니다.

데이터셋에서:

  • 실험 탭에서 복합 점수를 봅니다. 런의 평균 복합 점수를 기준으로 실험을 필터링하고 정렬할 수도 있습니다.
  • 실험을 클릭해 각 런의 복합 점수를 봅니다.

참고: 구성된 평가기 중 어떤 것이 런에 구성되어 있지 않으면 해당 런에 대해서는 복합 점수가 계산되지 않습니다.

더 알아보기