TruLens 소개 — AI 에이전트의 평가와 추적
TruLens 소개
일반 소프트웨어와 달리 AI 에이전트는 실패 방식이 달라요. 어느 도구를 골랐는지, 계획을 지켰는지, 답이 근거에 기반했는지가 결과를 좌우하죠. TruLens는 그런 실패 지점을 찾아내고 비용을 낮추는 데 초점을 맞춘 오픈소스 평가·추적 도구예요. OpenTelemetry 네이티브로 동작해서 "vibes" 대신 지표로 에이전트를 판단하게 도와줍니다.
무슨 일을 하나요
- 추적(Tracing): 스팬마다 지연·입력·출력·토큰·비용을 기록해 나쁜 답의 원인을 눈으로 추적
- 평가(Evals): 판정기(judge)가 점수와 함께 이유를 설명해 낮은 점수의 원인을 짚어줌
- 벤치마크된 판정기: 사람 주석으로 검증된 최고 수준의 판정기를 기본 제공
- 도메인 맞춤: 판정기를 루브릭·예제로 내 데이터에 맞게 조정
평가 메트릭 예시
- Agentic: Tool Selection, Plan Adherence, Execution Efficiency
- RAG: Groundedness, Context Relevance, Answer Relevance
- Safety: Harmfulness, Toxicity, Maliciousness
사용 예시
from trulens.apps.app import TruApp
tru_rag = TruApp(
rag,
app_name="SupportAgent",
app_version="v3",
feedbacks=[f_groundedness, f_answer_relevance, f_context_relevance],
)
with tru_rag as recording:
rag.query("Which policy covers this claim?")