응답 관련성
응답 관련성 (Answer Relevancy)
RAG 생성기가 만든 응답이 입력 쿼리와 얼마나 관련 있는지 확인하고 싶을 때가 있죠. Answer Relevancy는 RAG 생성기 평가를 위해 설계된 single-turn 메트릭으로, LLM-as-a-judge를 사용해 RAG 생성기의 출력이 주어진 입력과 관련 있는지 평가해요. 이 글에서 동작 원리와 사용법을 살펴볼게요.
출처: 문서
본문
개요
answer relevancy 메트릭은 LLM-as-a-judge를 사용해 RAG 생성기의 출력이 주어진 입력과 관련 있는지 평가해요. RAG QA 평가를 위해 특별히 설계된 single-turn 메트릭이며, 일반적인 RAG용은 아니에요.
answer relevancy 메트릭을 사용할 때 테스트 케이스의 input에는 전체 프롬프트가 아니라 질문만 넣어야 해요.
필수 파라미터
answer relevancy 메트릭을 평가하려면 테스트 케이스에 다음 파라미터를 제공해야 해요.
input (string, required)
RAG 애플리케이션에 제공하는 입력 쿼리.
actual_output (string, required)
RAG 애플리케이션의 생성기가 만들어낸 최종 출력.
어떻게 계산되나요?
answer relevancy 메트릭은 먼저 테스트 케이스의 actual output을 서로 다른 문장들로 쪼갠 뒤, 그 문장 중 주어진 입력과 관련 있는 것의 비율을 계산해요.
$$ \text{Answer Relevancy} = \frac{\text{Number of Relevant Statements}}{\text{Total Number of Statements}} $$
최종 점수는 actual output에서 찾은 관련 문장의 비율이에요.
사용 방법
Confident AI에서 answer relevancy 메트릭을 실행하려면 single-turn metric collection에 추가하세요. 그러면 다음에 사용할 수 있어요.
- Single-turn E2E 테스트
- Single-turn component-level 테스트
- trace와 span의 온라인 및 오프라인 eval
더 알아보기
- Contextual Relevancy — 검색 컨텍스트 관련성 메트릭
- Metric Collections — 원격 평가를 위한 메트릭 묶기