LlamaIndex — 파이프라인 전체를 평가한다

LlamaIndex — 파이프라인 전체를 평가한다

LlamaIndex RAG 파이프라인의 품질을 어떻게 알 수 있을까요? Evaluation 가이드는 리트리버·응답 생성 각 단계와 LLM-as-judge 기반 판정으로 파이프라인 전체를 평가하는 방법을 알려줘요.

두 축으로 나눠 보는 평가

  • 응답 평가: 생성된 답변이 질문에 충실하고 정확한지 평가해요.
  • 리트리버 평가: 검색된 문서가 질문과 관련 있는지, 필요한 모든 정보를 담았는지 평가해요.

LLM-as-judge 활용

LlamaIndex는 CorrectnessEvaluator, RelevancyEvaluatorLLM 기반 평가기를 제공해요. 평가 LLM에 기준을 주고 답변을 점수화하죠.

  • Faithfulness: 답변이 주어진 컨텍스트에 기반해 환각이 없는지.
  • Relevancy: 답변이 질문과 관련 있는지.
  • Context Relevancy: 검색된 컨텍스트가 질문에 얼마나 적합한지.

실전 흐름

EvaluationResult 객체가 각 단계의 점수와 이유(passing/failing)를 담아요. 파이프라인 구조(리트리버, 청크 크기, 프롬프트)를 바꿀 때마다 같은 벤치마크를 돌려 개선 여부를 확인해요.

더 알아보기