TruLens 소개 — AI 에이전트의 평가와 추적

TruLens 소개

일반 소프트웨어와 달리 AI 에이전트는 실패 방식이 달라요. 어느 도구를 골랐는지, 계획을 지켰는지, 답이 근거에 기반했는지가 결과를 좌우하죠. TruLens는 그런 실패 지점을 찾아내고 비용을 낮추는 데 초점을 맞춘 오픈소스 평가·추적 도구예요. OpenTelemetry 네이티브로 동작해서 "vibes" 대신 지표로 에이전트를 판단하게 도와줍니다.

출처: https://www.trulens.org/

무슨 일을 하나요

  • 추적(Tracing): 스팬마다 지연·입력·출력·토큰·비용을 기록해 나쁜 답의 원인을 눈으로 추적
  • 평가(Evals): 판정기(judge)가 점수와 함께 이유를 설명해 낮은 점수의 원인을 짚어줌
  • 벤치마크된 판정기: 사람 주석으로 검증된 최고 수준의 판정기를 기본 제공
  • 도메인 맞춤: 판정기를 루브릭·예제로 내 데이터에 맞게 조정

평가 메트릭 예시

  • Agentic: Tool Selection, Plan Adherence, Execution Efficiency
  • RAG: Groundedness, Context Relevance, Answer Relevance
  • Safety: Harmfulness, Toxicity, Maliciousness

사용 예시

from trulens.apps.app import TruApp

tru_rag = TruApp(
    rag,
    app_name="SupportAgent",
    app_version="v3",
    feedbacks=[f_groundedness, f_answer_relevance, f_context_relevance],
)

with tru_rag as recording:
    rag.query("Which policy covers this claim?")

더 알아보기