DeepEval
DeepEval
DeepEval은 LLM 애플리케이션·AI 에이전트·RAG 파이프라인을 테스트하고 벤치마킹하기 위한 오픈소스 LLM 평가 프레임워크예요. pytest처럼 Pytest 스타일 단언으로 LLM 출력을 단위 테스트하고, LLM-as-a-judge 기반의 수십 가지 메트릭과 공식 벤치마크를 제공해요.
이 카테고리의 문서
- 평가 (Evals): 소개, 테스트 케이스, 단일·다중 턴, 컴포넌트 레벨
- 메트릭 (Metrics): 소개, 커스텀 메트릭, G-Eval, DAG, RAG·안전·대화 메트릭
- 벤치마크 (Benchmarks): 소개, MMLU·GSM8K·MMLU 등 공식 벤치마크