평가기
평가기 (Evaluators)
Haystack 파이프라인의 성능을 평가하기 위해 사용하는 컴포넌트들을 정리해 둔 목록이에요.
출처: 문서
본문
| 평가기 | 설명 |
|---|---|
| AnswerExactMatchEvaluator | 정답 레이블(ground truth)을 기준으로 Haystack 파이프라인이 예측한 답변을 평가해요. 예측된 답과 정답을 문자 단위로 정확히 일치하는지 확인해요. |
| ContextRelevanceEvaluator | LLM을 사용해 생성된 답변이 제공된 맥락에서 추론 가능한지 평가해요. |
| DeepEvalEvaluator | DeepEval을 사용해 생성형 파이프라인을 평가해요. |
| DocumentMAPEvaluator | 정답 레이블을 기준으로 Haystack 파이프라인이 검색한 문서를 평가해요. 검색된 문서 목록이 정답 레이블에 명시된 관련 문서만 포함하는지, 아니면 관련 없는 문서도 포함하는지 그 정도를 확인해요. |
| DocumentMRREvaluator | 정답 레이블을 기준으로 Haystack 파이프라인이 검색한 문서를 평가해요. 정답 문서가 검색된 문서 목록에서 몇 번째 순위에 나타나는지 확인해요. |
| DocumentNDCGEvaluator | 정답 레이블을 기준으로 Haystack 파이프라인이 검색한 문서를 평가해요. 정답 문서가 검색된 문서 목록에서 몇 번째 순위에 나타나는지 확인해요. 이 지표를 정규화 할인 누적 이득(NDCG)이라고 불러요. |
| DocumentRecallEvaluator | 정답 레이블을 기준으로 Haystack 파이프라인이 검색한 문서를 평가해요. 정답 문서 중 몇 개나 검색되었는지 확인해요. |
| FaithfulnessEvaluator | LLM을 사용해 생성된 답변이 제공된 맥락에서 추론 가능한지 평가해요. 정답 레이블이 필요 없어요. |
| LLMEvaluator | LLM을 사용해 사용자가 정의한 지침과 예시가 담긴 프롬프트를 기준으로 입력을 평가해요. |
| RagasEvaluator | Ragas 프레임워크를 사용해 검색 증강 생성(RAG) 파이프라인을 평가해요. |
| SASEvaluator | 정답 레이블을 기준으로 Haystack 파이프라인이 예측한 답변을 평가해요. 미세 조정된 언어 모델을 사용해 예측 답과 정답의 의미적 유사도를 확인해요. |