DeepEval
DeepEval
DeepEval은 LLM용 오픈소스 평가 프레임워크예요(Github). 여기서는 LiteLLM이 어떻게 DeepEval(Confident AI)과 연동되어 추적·모니터링·평가를 한곳에서 처리하는지 알려드릴게요.
출처: 문서
본문
DeepEval이 뭔가요?
DeepEval은 LLM을 위한 오픈소스 평가 프레임워크예요(Github).
Confident AI가 뭔가요?
Confident AI(deepeval 플랫폼)는 팀이 LLM 애플리케이션을 추적하고 모니터링할 수 있는 Observatory를 제공해요. LLM 앱을 위한 Datadog이라고 생각하시면 돼요. Observatory를 통해 다음을 할 수 있어요:
- LLM 애플리케이션의 문제를 실시간으로 감지하고 디버깅
- 강력한 필터로 과거 생성 데이터를 검색하고 분석
- 모델 응답에 대한 인간 피드백 수집
- 평가를 실행해 성능 측정 및 개선
- 비용과 지연 시간을 추적해 리소스 사용 최적화
빠른 시작 (Quickstart)
import os
import time
import litellm
os.environ['OPENAI_API_KEY']='<your-openai-api-key>'
os.environ['CONFIDENT_API_KEY']='<your-confident-api-key>'
litellm.success_callback = ["deepeval"]
litellm.failure_callback = ["deepeval"]
try:
response = litellm.completion(
model="gpt-5.6-luna",
messages=[
{"role": "user", "content": "What's the weather like in San Francisco?"}
],
)
except Exception as e:
print(e)
print(response)
info —
CONFIDENT_API_KEY는 Confident AI 플랫폼에 로그인하면 얻을 수 있어요.
지원 및 DeepEval 팀과 소통 (Support & Talk with Deepeval team)
더 알아보기 (Learn more)
- DeepEval — LLM 평가 오픈소스 프레임워크
- Confident AI Observatory — LLM 앱 추적·모니터링 플랫폼