에이전트 평가 퀵스타트

에이전트 평가 퀵스타트 (Agent Evaluation Quickstart)

agent_evals 템플릿은 수학 문제를 푸는 AI 에이전트를 정확도 메트릭으로 평가하기 위한 설정을 제공해요. 프로젝트 생성부터 의존성 설치, 평가 실행까지 간단한 단계로 진행할 수 있어요.

출처: 문서

본문

agent_evals 템플릿은 correctness 메트릭으로 수학 문제를 푸는 AI 에이전트를 평가하기 위한 설정을 제공해요.

프로젝트 만들기

ragas quickstart agent_evals
cd agent_evals

의존성 설치

uv sync

API 키 설정

export OPENAI_API_KEY="your-openai-key"

평가 실행

uv run python evals.py

프로젝트 구조

agent_evals/
├── README.md              # Project documentation
├── pyproject.toml         # Project configuration
├── agent.py               # Math solving agent implementation
├── evals.py               # Evaluation workflow
├── __init__.py            # Python package marker
└── evals/
    ├── datasets/          # Test datasets
    ├── experiments/       # Evaluation results
    └── logs/              # Execution logs

무엇을 평가하나

템플릿은 AI 에이전트의 수학 표현식 해결 능력을 평가해요.

  • Agent: 도구를 사용해서 수학 문제를 단계별로 해결
  • Test Cases: (2 + 3) * (6 - 2), 100 / 5 + 3 * 2 같은 수학 표현식
  • Metric: 이진 correctness (맞으면 1.0, 틀리면 0.0)

코드 이해하기

에이전트 (agent.py)

계산기 도구로 수학 문제를 푸는 에이전트를 구현해요.

from agent import get_default_agent

math_agent = get_default_agent()
result = math_agent.solve("15 - 3 / 4")

평가 (evals.py)

다양한 수학 문제에서 에이전트를 테스트해요.

@numeric_metric(name="correctness", allowed_values=(0.0, 1.0))
def correctness_metric(prediction: float, actual: float):
    result = 1.0 if abs(prediction - actual) < 1e-5 else 0.0
    return MetricResult(value=result, reason=f"Prediction: {prediction}, Actual: {actual}")

더 알아보기 (Learn more)