에이전트 평가 퀵스타트
에이전트 평가 퀵스타트 (Agent Evaluation Quickstart)
agent_evals 템플릿은 수학 문제를 푸는 AI 에이전트를 정확도 메트릭으로 평가하기 위한 설정을 제공해요. 프로젝트 생성부터 의존성 설치, 평가 실행까지 간단한 단계로 진행할 수 있어요.
출처: 문서
본문
agent_evals 템플릿은 correctness 메트릭으로 수학 문제를 푸는 AI 에이전트를 평가하기 위한 설정을 제공해요.
프로젝트 만들기
ragas quickstart agent_evals
cd agent_evals
의존성 설치
uv sync
API 키 설정
export OPENAI_API_KEY="your-openai-key"
평가 실행
uv run python evals.py
프로젝트 구조
agent_evals/
├── README.md # Project documentation
├── pyproject.toml # Project configuration
├── agent.py # Math solving agent implementation
├── evals.py # Evaluation workflow
├── __init__.py # Python package marker
└── evals/
├── datasets/ # Test datasets
├── experiments/ # Evaluation results
└── logs/ # Execution logs
무엇을 평가하나
템플릿은 AI 에이전트의 수학 표현식 해결 능력을 평가해요.
- Agent: 도구를 사용해서 수학 문제를 단계별로 해결
- Test Cases:
(2 + 3) * (6 - 2),100 / 5 + 3 * 2같은 수학 표현식 - Metric: 이진 correctness (맞으면 1.0, 틀리면 0.0)
코드 이해하기
에이전트 (agent.py)
계산기 도구로 수학 문제를 푸는 에이전트를 구현해요.
from agent import get_default_agent
math_agent = get_default_agent()
result = math_agent.solve("15 - 3 / 4")
평가 (evals.py)
다양한 수학 문제에서 에이전트를 테스트해요.
@numeric_metric(name="correctness", allowed_values=(0.0, 1.0))
def correctness_metric(prediction: float, actual: float):
result = 1.0 if abs(prediction - actual) < 1e-5 else 0.0
return MetricResult(value=result, reason=f"Prediction: {prediction}, Actual: {actual}")
더 알아보기 (Learn more)
- LlamaIndex Agent Evaluation - LlamaIndex 에이전트 평가
- Custom Metrics - 자신만의 메트릭 작성