응답 관련성

응답 관련성 (Answer Relevancy)

RAG 생성기가 만든 응답이 입력 쿼리와 얼마나 관련 있는지 확인하고 싶을 때가 있죠. Answer Relevancy는 RAG 생성기 평가를 위해 설계된 single-turn 메트릭으로, LLM-as-a-judge를 사용해 RAG 생성기의 출력이 주어진 입력과 관련 있는지 평가해요. 이 글에서 동작 원리와 사용법을 살펴볼게요.

출처: 문서

본문

개요

answer relevancy 메트릭은 LLM-as-a-judge를 사용해 RAG 생성기의 출력이 주어진 입력과 관련 있는지 평가해요. RAG QA 평가를 위해 특별히 설계된 single-turn 메트릭이며, 일반적인 RAG용은 아니에요.

answer relevancy 메트릭을 사용할 때 테스트 케이스의 input에는 전체 프롬프트가 아니라 질문만 넣어야 해요.

필수 파라미터

answer relevancy 메트릭을 평가하려면 테스트 케이스에 다음 파라미터를 제공해야 해요.

input (string, required)

RAG 애플리케이션에 제공하는 입력 쿼리.

actual_output (string, required)

RAG 애플리케이션의 생성기가 만들어낸 최종 출력.

어떻게 계산되나요?

answer relevancy 메트릭은 먼저 테스트 케이스의 actual output을 서로 다른 문장들로 쪼갠 뒤, 그 문장 중 주어진 입력과 관련 있는 것의 비율을 계산해요.

$$ \text{Answer Relevancy} = \frac{\text{Number of Relevant Statements}}{\text{Total Number of Statements}} $$

최종 점수는 actual output에서 찾은 관련 문장의 비율이에요.

사용 방법

Confident AI에서 answer relevancy 메트릭을 실행하려면 single-turn metric collection에 추가하세요. 그러면 다음에 사용할 수 있어요.

  • Single-turn E2E 테스트
  • Single-turn component-level 테스트
  • trace와 span의 온라인 및 오프라인 eval

더 알아보기