콘텐츠로 이동

RAG 평가 (Evaluation)

RAG 파이프라인을 고치면 답이 실제로 나아졌는지 어떻게 알까요? "느낌상 좋아졌다"로는 검색 단계를 바꿀 때마다 판단을 내릴 수 없어요. 그래서 정확도와 근거 충실성 같은 지표로 파이프라인을 계속 측정하는 일이 RAG 평가(Evaluation) 입니다.

이 페이지는 소스 문서 Ragas Metrics 를 바탕으로, RAG를 볼 때 주로 보는 지표를 설명합니다.


상황부터 — 검색·생성을 숫자로 봐야 하는 이유

청킹 크기, Top-K, 임베딩 모델, 재순위화 — 이 중 하나를 바꾸면 답이 좋아지기도 나빠지기도 해요. 매번 사람이 일일이 읽어 판단하기엔 케이스가 많고 일관성도 떨어지는데, 지표로 측정하면 "이 변경이 검색 정확도를 올렸다/내렸다"를 객관적으로 비교할 수 있습니다.


핵심 개념

RAG 평가는 보통 검색 단계생성 단계를 나눠 봅니다.

검색 단계 — 정확도(Precision/Recall)

  • Context Precision(정밀도) — 검색해서 뽑은 조각 중 질문에 실제로 관련 있는 것이 얼마나 되는지. 뽑은 게 정확한가를 봅니다. 관련 없는 조각이 많으면 낮아져요.
  • Context Recall(재현율) — 질문에 필요한 정보를 검색이 얼마나 빠짐없이 찾았는지. 필요한 조각을 놓치면 낮아집니다.
  • 이 둘은 서로 트레이드오프가 있어요. Top-K를 늘리면 재현율은 오르지만 정밀도가 떨어지기 쉽죠.

생성 단계 — 근거 충실성·답 관련성

  • 근거 충실성(Faithfulness) — 생성된 답의 주장이 검색된 근거(context)에서 모두 뒷받침되는지. 답의 주장 중 근거로 확인되는 비율을 셉니다. 근거 없는 주장이 많으면 낮아져, 환각을 잡아냅니다.
  • 답 관련성(Answer Relevancy) — 답이 질문에 실제로 맞는지. 질문과 동떨어진 답이면 낮아집니다.

측정 방식

LLM 기반 지표는 LLM(판정자)이 답의 주장을 분해하고 근거와 대조해 점수를 매깁니다. 점수를 0~1로 환산해 파이프라인 변경 전후를 비교합니다.


사용 사례 / 실제 적용

  • 파이프라인 변경 검증 — 청킹 크기·Top-K·재순위화 도입 전후의 정확도·충실성 점수를 비교해 변경 채택을 결정합니다.
  • 환각 감지 — 근거 충실성이 낮은 답을 찾아, 검색이 근거를 제대로 못 찾는 문제인지 생성이 근거 밖을 지어내는 문제인지 추적합니다.
  • 정책문서 답변 품질 관리 — 사내 정책 답변이 정책 조항에서 벗어나지 않는지 지표로 확인합니다.

더 알아보기