퓨샷 예시로 평가자 개선하기

퓨샷 예시로 평가자 개선하기

시스템을 프로그래밍 방식으로 평가할 수 없을 때 LLM-as-a-judge 평가자를 사용하면 매우 유용해요. 하지만 그 효과는 평가자의 품질과 인간 리뷰어 피드백과의 정렬 정도에 달려 있어요. LangSmith는 퓨샷 예시를 사용해 LLM-as-a-judge 평가자를 인간 선호도에 더 잘 맞추는 기능을 제공해요.

인간의 수정 사항은 퓨샷 예시를 사용해 평가자 프롬프트에 자동으로 삽입돼요. 퓨샷 예시는 퓨샷 프롬프팅에서 영감을 받은 기법으로, 소수의 고품질 예시로 모델의 출력을 안내해요.

이 가이드는 LLM-as-a-judge 평가자의 일부로 퓨샷 예시를 설정하고 피드백 점수에 수정을 적용하는 방법을 다뤄요.

출처: 문서

본문

퓨샷 예시의 작동 방식

  • 퓨샷 예시는 {{Few-shot examples}} 변수를 사용해 평가자 프롬프트에 추가돼요.
  • 퓨샷 예시로 평가자를 만들면 자동으로 데이터셋이 생성되며, 수정을 시작하면 이 데이터셋이 퓨샷 예시로 자동 채워져요.
  • 런타임에는 이러한 예시가 평가자에 삽입되어 출력의 지침 역할을 해요. 이렇게 하면 평가자가 인간 선호도와 더 잘 정렬되도록 도와줘요.

평가자 구성하기

퓨샷 예시는 현재 프롬프트 허브를 사용하는 LLM-as-a-judge 평가자에서는 지원되지 않으며, mustache 형식을 사용하는 프롬프트에서만 호환돼요.

퓨샷 예시는 스레드 레벨이 아닌 런 레벨 평가자에서만 지원돼요. Configure Evaluator 패널에서 Runs를 켜세요.

퓨샷 예시를 활성화하기 전에 LLM-as-a-judge 평가자를 설정하세요. 아직 하지 않았다면 LLM-as-a-judge 평가자 가이드의 단계를 따르세요.

1. 변수 매핑 구성하기

각 퓨샷 예시는 구성에 지정된 변수 매핑에 따라 형식이 지정돼요. 퓨샷 예시의 변수 매핑은 기본 프롬프트와 동일한 변수에 더해 few_shot_explanation과 피드백 키와 동일한 이름의 score 변수가 포함되어야 해요.

예를 들어 기본 프롬프트에 questionresponse 변수가 있고 평가자가 correctness 점수를 출력한다면, 퓨샷 프롬프트에는 question, response, few_shot_explanation, correctness 변수가 있어야 해요.

2. 사용할 퓨샷 예시 수 지정하기

사용할 퓨샷 예시 수를 지정할 수도 있어요. 기본값은 5예요. 예시가 매우 길다면 토큰을 아끼기 위해 이 숫자를 낮추고, 예시가 짧은 경향이 있다면 평가자가 더 많은 예시를 학습하도록 더 높은 숫자를 설정할 수 있어요. 데이터셋에 이 숫자보다 많은 예시가 있다면 무작위로 선택해줘요.

수정하기

평가자 점수 감사

트레이스를 기록하거나 실험을 실행하기 시작하면 평가자가 부여한 일부 점수에 동의하지 않을 가능성이 있어요. 이 점수를 수정하면 수정 데이터셋 안에 예시가 채워지기 시작하는 것을 볼 수 있어요. 수정할 때 설명을 첨부하세요—이 설명이 평가자 프롬프트에서 few_shot_explanation 변수 자리에 채워져요.

퓨샷 예시의 입력은 체인/데이터셋의 입력, 출력 및 (오프라인 평가자라면) 참조의 관련 필드가 돼요. 출력은 수정된 평가자 점수와 수정을 남길 때 만든 설명이에요. 원하는 대로 편집해도 돼요. 다음은 수정 데이터셋의 퓨샷 예시 예시예요:

Few-shot example

수정이 퓨샷 데이터셋에 채워지는 데 1~2분이 걸릴 수 있어요. 채워지면 이후 평가자 실행에서 프롬프트에 포함돼요!

수정 데이터셋 보기

수정 데이터셋을 보려면:

  • 온라인 평가자: 런 규칙을 선택하고 Edit Rule을 클릭하세요.
  • 오프라인 평가자: 평가자를 선택하고 Edit Evaluator를 클릭하세요.

Edit Evaluator

Improve evaluator accuracy using few-shot examples 섹션에 연결된 수정 데이터셋으로 이동하세요. 데이터셋에서 퓨샷 예시를 보고 업데이트할 수 있어요.

View few-shot dataset

더 알아보기 (Learn more)