TruLens 시작 — RAG Triad와 단계 평가
TruLens 시작
TruLens 공식 README의 핵심 메시지는 '그냥 vibe-check 하지 말고 체계적으로 평가·추적하라'는 거예요. 프롬프트·모델·리트리버·지식 소스를 만들면서 성능을 이해하는 것이 목표예요.
핵심 개념
- RAG Triad — Groundedness·Context Relevance·Answer Relevance. RAG 앱의 답이 '검색된 근거로 뒷받침되는지'를 점검하는 표준 평가야요.
- 개방형 평가 —
trulens.core의Metric,Selector,BatchEvaluator같은 추상화. 같은 메트릭을 라이브 트레이스나 데이터셋 평가 어느 쪽에도 적용해요. - Honest, Harmless, Helpful 평가 — 모델 출력의 정직·무해·유용성까지 봐요.
빠르게 시작하기
from trulens.apps.app import TruApp
tru_rag = TruApp(
rag,
app_name="SupportAgent",
app_version="v3",
feedbacks=[f_groundedness, f_answer_relevance, f_context_relevance],
)
with tru_rag as recording: 블록으로 트레이스를 기록하면 평가 계산이 자동으로 시작돼요. 라이브 트레이스 평가든 runs로 데이터셋 재생이든 같은 메트릭이라, 스코어와 리더보드가 일관되게 나와요.