컨텍스트 재현율

컨텍스트 재현율 (Contextual Recall)

RAG 시스템에서 리트리버가 기대 출력과 비슷한 답을 만들기에 충분한 관련 컨텍스트를 가져왔는지 확인하고 싶을 때가 있죠. Contextual Recall은 그런 single-turn RAG 메트릭으로, LLM-as-a-judge를 사용해 리트리버가 기대 출력과 유사한 답을 만들기에 충분한 관련 컨텍스트를 표면화했는지 평가해요.

출처: 문서

본문

개요

contextual recall 메트릭은 LLM-as-a-judge를 사용해 리트리버가 기대 출력과 유사한 답을 만들기에 충분한 관련 컨텍스트를 표면화했는지 평가하는 single-turn RAG 메트릭이에요.

contextual recall 메트릭을 사용할 때 테스트 케이스의 input에는 전체 프롬프트가 아니라 질문만 넣어야 해요.

필수 파라미터

contextual recall 메트릭을 평가하려면 테스트 케이스에 다음 파라미터를 제공해야 해요.

input (string, required)

RAG 애플리케이션에 제공하는 입력 쿼리.

expected_output (string, required)

RAG 애플리케이션이 주어진 입력에 대해 생성해야 하는 기대 출력.

retrieval_context (list of string, required)

주어진 입력에 대해 리트리버가 출력한 검색 컨텍스트. 랭크 순으로 정렬돼 있어요.

어떻게 계산되나요?

contextual recall 메트릭은 먼저 LLM으로 expected output에서 서로 다른 문장들을 추출하고, 같은 LLM으로 그 문장 중 몇 개가 검색 컨텍스트 노드에 의해 뒷받침되는지 확인해요.

$$ \text{Contextual Recall} = \frac{\text{Number of Attributable Statements}}{\text{Total Number of Statements}} $$

최종 점수는 expected output에서 귀속(attribute) 가능한 문장의 비율이에요.

사용 방법

Confident AI에서 contextual recall 메트릭을 실행하려면 single-turn metric collection에 추가하세요. 그러면 다음에 사용할 수 있어요.

  • Single-turn E2E 테스트
  • Single-turn component-level 테스트
  • trace와 span의 온라인 및 오프라인 eval

더 알아보기