DeepEval

DeepEval

DeepEval은 LLM용 오픈소스 평가 프레임워크예요(Github). 여기서는 LiteLLM이 어떻게 DeepEval(Confident AI)과 연동되어 추적·모니터링·평가를 한곳에서 처리하는지 알려드릴게요.

출처: 문서

본문

DeepEval이 뭔가요?

DeepEval은 LLM을 위한 오픈소스 평가 프레임워크예요(Github).

Confident AI가 뭔가요?

Confident AI(deepeval 플랫폼)는 팀이 LLM 애플리케이션을 추적하고 모니터링할 수 있는 Observatory를 제공해요. LLM 앱을 위한 Datadog이라고 생각하시면 돼요. Observatory를 통해 다음을 할 수 있어요:

  • LLM 애플리케이션의 문제를 실시간으로 감지하고 디버깅
  • 강력한 필터로 과거 생성 데이터를 검색하고 분석
  • 모델 응답에 대한 인간 피드백 수집
  • 평가를 실행해 성능 측정 및 개선
  • 비용과 지연 시간을 추적해 리소스 사용 최적화

빠른 시작 (Quickstart)

import os
import time
import litellm


os.environ['OPENAI_API_KEY']='<your-openai-api-key>'
os.environ['CONFIDENT_API_KEY']='<your-confident-api-key>'

litellm.success_callback = ["deepeval"]
litellm.failure_callback = ["deepeval"]

try:
    response = litellm.completion(
        model="gpt-5.6-luna",
        messages=[
            {"role": "user", "content": "What's the weather like in San Francisco?"}
        ],
    )
except Exception as e:
    print(e)

print(response)

infoCONFIDENT_API_KEYConfident AI 플랫폼에 로그인하면 얻을 수 있어요.

지원 및 DeepEval 팀과 소통 (Support & Talk with Deepeval team)

더 알아보기 (Learn more)