TruLens 시작 — RAG Triad와 단계 평가

TruLens 시작

TruLens 공식 README의 핵심 메시지는 '그냥 vibe-check 하지 말고 체계적으로 평가·추적하라'는 거예요. 프롬프트·모델·리트리버·지식 소스를 만들면서 성능을 이해하는 것이 목표예요.

핵심 개념

  • RAG Triad — Groundedness·Context Relevance·Answer Relevance. RAG 앱의 답이 '검색된 근거로 뒷받침되는지'를 점검하는 표준 평가야요.
  • 개방형 평가trulens.coreMetric, Selector, BatchEvaluator 같은 추상화. 같은 메트릭을 라이브 트레이스나 데이터셋 평가 어느 쪽에도 적용해요.
  • Honest, Harmless, Helpful 평가 — 모델 출력의 정직·무해·유용성까지 봐요.

빠르게 시작하기

from trulens.apps.app import TruApp
tru_rag = TruApp(
    rag,
    app_name="SupportAgent",
    app_version="v3",
    feedbacks=[f_groundedness, f_answer_relevance, f_context_relevance],
)

with tru_rag as recording: 블록으로 트레이스를 기록하면 평가 계산이 자동으로 시작돼요. 라이브 트레이스 평가든 runs로 데이터셋 재생이든 같은 메트릭이라, 스코어와 리더보드가 일관되게 나와요.

더 알아보기