Summarization

Summarization

요약기가 사실에 부합하는 요약을 만들어내는지 확인하고 싶을 때 쓰는 단일 턴(single-turn) 지표예요. LLM-as-a-judge 방식으로 LLM이 텍스트를 요약하는 능력을 평가하는데, 원문에서 폐쇄형 질문(close-ended questions)을 만들어 낸 뒤 요약문이 그 질문에 정확히 답할 수 있는지 확인해요.

출처: 문서

본문

개요

summarization 지표는 단일 턴 지표로, LLM-as-a-judge를 사용해 LLM이 텍스트를 요약하는 능력을 평가해요. 원문에서 폐쇄형 질문을 생성하고, 요약문이 그 질문들에 정확히 답할 수 있는지 검사하는 방식이에요.

우리의 summarization 지표가 어떻게 개발되었는지에 대한 좋은 글도 읽어볼 만해요.

summarization 지표는 원문을 입력(input)으로, 생성된 요약문을 실제 출력(actual output)으로 가정해요.

필수 파라미터(Required Parameters)

summarization 지표로 평가를 실행하려면 테스트 케이스에 반드시 넣어야 하는 파라미터예요:

input (string, required)

요약 에이전트에 보내 요약할 텍스트예요.

actual_output (string, required)

요약 에이전트가 주어진 입력에 대해 만들어낸 요약문이에요.

지표 파라미터(Metric Parameters)

metric collection에 summarization 지표를 추가할 때 설정할 수 있는 파라미터들이에요:

assessment_questions (list of strings)

평가 질문들을 지정하는 문자열 목록이에요. 예를 들어 Is the coverage score based on a percentage of 'yes' answers?처럼요.

truths_extraction_limit (number)

실제 출력에서 추출할 truths(사실)의 최대 개수를 지정하는 정수예요.

계산 방식(How Is It Calculated?)

summarization 지표는 점수를 alignment_score와 coverage_score로 나눠요.

$$ \text{Summarization} = \text{min(\text{Alignement Score}, \text{Coverage Score})} $$

최종 점수는 다음 두 값 중 더 작은 값(minimum)이에요:

  • alignment_score — 요약문이 원문과 모순되거나 환각된 정보를 담고 있는지 판단해요.
  • coverage_score — 요약문이 원문의 필요한 정보를 담고 있는지 판단해요.

사용법(Usage)

Confident AI에서 summarization 지표를 실행하려면 단일 턴 metric collection에 추가하면 돼요. 그러면 summarization 지표를 다음에 활용할 수 있어요:

  • 단일 턴 E2E 테스트(Single-turn E2E testing)
  • 단일 턴 컴포넌트 레벨 테스트(Single-turn component-level testing)
  • 트레이스와 스팬의 온라인·오프라인 평가(Online and offline evals for traces and spans)

더 알아보기