RAG 평가 (Evaluation)¶
RAG 파이프라인을 고치면 답이 실제로 나아졌는지 어떻게 알까요? "느낌상 좋아졌다"로는 검색 단계를 바꿀 때마다 판단을 내릴 수 없어요. 그래서 정확도와 근거 충실성 같은 지표로 파이프라인을 계속 측정하는 일이 RAG 평가(Evaluation) 입니다.
이 페이지는 소스 문서 Ragas Metrics 를 바탕으로, RAG를 볼 때 주로 보는 지표를 설명합니다.
상황부터 — 검색·생성을 숫자로 봐야 하는 이유¶
청킹 크기, Top-K, 임베딩 모델, 재순위화 — 이 중 하나를 바꾸면 답이 좋아지기도 나빠지기도 해요. 매번 사람이 일일이 읽어 판단하기엔 케이스가 많고 일관성도 떨어지는데, 지표로 측정하면 "이 변경이 검색 정확도를 올렸다/내렸다"를 객관적으로 비교할 수 있습니다.
핵심 개념¶
RAG 평가는 보통 검색 단계와 생성 단계를 나눠 봅니다.
검색 단계 — 정확도(Precision/Recall)¶
- Context Precision(정밀도) — 검색해서 뽑은 조각 중 질문에 실제로 관련 있는 것이 얼마나 되는지. 뽑은 게 정확한가를 봅니다. 관련 없는 조각이 많으면 낮아져요.
- Context Recall(재현율) — 질문에 필요한 정보를 검색이 얼마나 빠짐없이 찾았는지. 필요한 조각을 놓치면 낮아집니다.
- 이 둘은 서로 트레이드오프가 있어요. Top-K를 늘리면 재현율은 오르지만 정밀도가 떨어지기 쉽죠.
생성 단계 — 근거 충실성·답 관련성¶
- 근거 충실성(Faithfulness) — 생성된 답의 주장이 검색된 근거(context)에서 모두 뒷받침되는지. 답의 주장 중 근거로 확인되는 비율을 셉니다. 근거 없는 주장이 많으면 낮아져, 환각을 잡아냅니다.
- 답 관련성(Answer Relevancy) — 답이 질문에 실제로 맞는지. 질문과 동떨어진 답이면 낮아집니다.
측정 방식¶
LLM 기반 지표는 LLM(판정자)이 답의 주장을 분해하고 근거와 대조해 점수를 매깁니다. 점수를 0~1로 환산해 파이프라인 변경 전후를 비교합니다.
사용 사례 / 실제 적용¶
- 파이프라인 변경 검증 — 청킹 크기·Top-K·재순위화 도입 전후의 정확도·충실성 점수를 비교해 변경 채택을 결정합니다.
- 환각 감지 — 근거 충실성이 낮은 답을 찾아, 검색이 근거를 제대로 못 찾는 문제인지 생성이 근거 밖을 지어내는 문제인지 추적합니다.
- 정책문서 답변 품질 관리 — 사내 정책 답변이 정책 조항에서 벗어나지 않는지 지표로 확인합니다.
더 알아보기¶
- 공식 문서 (1차): Ragas 지표 목록, Ragas Faithfulness
- 큐레이션/블로그 (2차): Cohere 블로그