RAG 평가 실습 — 요약·생성 품질을 cookbook으로 측정
RAG 평가 실습
공식 cookbook의 evaluate_rag_with_llamaindex는 RAG 시스템을 측정 가능하게 만드는 예시예요. 문서 인덱싱 없이 원본 데이터를 직접 전달하는 방식으로 평가 셋업을 단순화해서 시작할 수 있어요.
평가할 것들
RAG에서는 생성된 답변의 질뿐 아니라 검색(retrieval) 품질도 살펴야 해요. 질문별로 관련 문서가 잘 뽑혔는지, 답변이 그 문서에 근거했는지가 관건이에요.
기본 구조
- 질문·참고답변·문서로 이루어진 데이터셋을 정의해요.
- 에이전트/파이프라인을 실행해 답변을 생성해요.
- reference와 비교해 정확성·충실도를 판정해요.
# 개념적 흐름
for item in dataset:
response = pipeline.query(item["question"])
verdict = judge_against(item["reference_answer"], response)
record(verdict)
왜 중요한가
수동으로 '대충 잘 대답하네'라고 넘기면, 검색이 엉뚱한 문서를 뽑는 회귀를 놓치기 쉬워요. 정량 평가 셋업을 만들어 두면 개선 전후를 수치로 비교하며 RAG를 건강하게 유지할 수 있어요.