AgentEvals — 궤적 매칭과 LLM 심판
AgentEvals — 궤적 매칭과 LLM 심판
agentevals 패키지는 에이전트 궤적의 궤적 매칭(결정적 비교)과 LLM 심판(정성 평가)을 제공해요.
궤적 매칭 모드
create_trajectory_match_evaluator는 네 가지 모드를 제공해요:
strict: 메시지 구조와 도구 호출이 같은 순서로 정확히 일치unordered: 도구 호출이 순서 무관하게 일치subset: 참조 도구만 호출(추가 없음 — 범위 초과 방지)superset: 참조 도구를 최소한 모두 호출(추가 허용 — 필수 행동 검증)
LLM 심판
참조 궤적 없이도 질적 평가를 create_trajectory_llm_as_judge로 할 수 있고, 참조가 있으면 TRAJECTORY_ACCURACY_PROMPT_WITH_REFERENCE를 써요.
evaluator = create_trajectory_llm_as_judge(model="openai:o3-mini", prompt=TRAJECTORY_ACCURACY_PROMPT)
evaluation = evaluator(outputs=result["messages"])
에이전트의 선택들은 모두 asyncio(비동기) 버전을 지원해요.