RAGAS 사용 가능한 메트릭
RAGAS 사용 가능한 메트릭
Ragas는 LLM 애플리케이션의 성능을 객관적으로 측정하기 위한 평가 메트릭 세트를 제공해요. RAG 워크플로우와 에이전트 워크플로우 같은 다양한 애플리케이션과 태스크에 맞춰 메트릭이 준비돼 있는데요, 각 메트릭은 애플리케이션의 특정 측면을 평가하도록 설계된 일종의 패러다임이에요. LLM 기반 메트릭은 점수를 내기 위해 한 번 이상의 LLM 호출을 사용할 수 있고, 필요하면 직접 커스텀 메트릭을 작성해 쓸 수도 있어요.
Retrieval Augmented Generation
RAG 시스템에 쓰는 핵심 메트릭들이에요.
- Context Precision: 검색된 컨텍스트의 순위가 얼마나 잘 매겨졌는지 평가해요.
- Context Recall: 관련 문서를 얼마나 빠뜨리지 않고 검색했는지 측정해요.
- Context Entities Recall: 컨텍스트에서 개체(entity) 단위로 재현율을 평가해요.
- Noise Sensitivity: 검색 결과에 섞인 노이즈가 답변 품질에 얼마나 영향을 주는지 봐요.
- Response Relevancy: 생성된 답변이 질문에 얼마나 관련성 있게 대답하는지 평가해요.
- Faithfulness: 답변이 검색된 컨텍스트와 얼마나 사실적으로 일치하는지 측정해요.
- Multimodal Faithfulness, Multimodal Relevance: 이미지 같은 멀티모달 입력을 다루는 RAG용 메트릭이에요.
Nvidia Metrics
NVIDIA가 제공하는 메트릭들이에요.
- Answer Accuracy: 답변의 정확도를 평가해요.
- Context Relevance: 컨텍스트의 관련성을 측정해요.
- Response Groundedness: 답변이 주어진 맥락에 grounding(근거 두기)되어 있는지 봐요.
Agents or Tool use cases
에이전트·도구 호출 시나리오용 메트릭이에요.
- Topic adherence: 대화가 주제에서 벗어나지 않는지 확인해요.
- Tool call Accuracy: 도구 호출의 정확도를 평가해요.
- Tool Call F1: 도구 호출에 대한 F1 점수를 계산해요.
- Agent Goal Accuracy: 에이전트가 목표를 달성했는지 측정해요.
Natural Language Comparison
자연어 출력을 비교하는 메트릭들이에요.
- Factual Correctness: 답변의 사실적 정확성을 평가해요.
- Semantic Similarity: 의미적 유사도를 측정해요.
- Non LLM String Similarity: LLM 없이 문자열 유사도를 계산해요.
- BLEU Score, CHRF Score, ROUGE Score: 전통적인 자동평가 지표들이에요.
- String Presence, Exact Match: 문자열 포함 여부와 정확 일치를 확인해요.
SQL
SQL 생성 결과를 평가하는 메트릭이에요.
- Execution based Datacompy Score: 실행 기반 평가로 쿼리 결과를 비교해요.
- SQL query Equivalence: SQL 쿼리 간 의미적 동등성을 판단해요.
General purpose
특정 태스크에 국한되지 않는 범용 메트릭이에요.
- Aspect critic: 특정 측면에 대한 비평을 이용해 평가해요.
- Simple Criteria Scoring: 단순 기준으로 점수를 매겨요.
- Rubrics based scoring, Instance specific rubrics scoring: 루브릭(rubrics) 기반 점수 매기기 방식이에요.
Other tasks
- Summarization: 요약 결과의 품질을 평가하는 메트릭이에요.