인자 정확도
인자 정확도 (Argument Correctness)
LLM 에이전트가 호출하는 tool에 올바른 인자를 전달하는지 확인하고 싶을 때가 있죠. Argument Correctness는 그런 single-turn 메트릭으로, LLM-as-a-judge를 사용해 에이전트가 호출한 tool에 올바른 인자를 생성했는지 평가해요.
출처: 문서
본문
개요
argument correctness 메트릭은 LLM-as-a-judge를 사용해 LLM 에이전트가 호출하는 tool에 올바른 인자를 생성했는지 평가하는 single-turn 메트릭이에요.
argument correctness 메트릭은 에이전트가 각 tool에 전달한 인자를 평가해요. 올바른 tool을 골랐는지는 다루지 않아요. tool 선택을 기대 tool과 결정적으로 대조하려면 tool correctness 메트릭을 사용하세요.
필수 파라미터
argument correctness 메트릭을 평가하려면 테스트 케이스에 다음 파라미터를 제공해야 해요.
input (string, required)
LLM 에이전트에 제공한 입력.
actual_output (string, required)
LLM 에이전트가 주어진 입력에 대해 생성한 최종 출력.
tools_called (list, required)
LLM 에이전트가 호출한 tool의 목록. ToolCall 인스턴스에서 호출된 순서대로 나열돼 있어요.
어떻게 계산되나요?
argument correctness 메트릭은 tools called의 각 tool call을 순회하면서, LLM으로 해당 호출의 입력 파라미터가 input에 기술된 작업에 대해 올바른지 판단해요.
$$ \text{Argument Correctness} = \frac{\text{Number of Correctly Generated Input Parameters}}{\text{Total Number of Tool Calls}} $$
최종 점수는 에이전트가 올바른 인자를 제공한 tool call의 비율이에요.
사용 방법
Confident AI에서 argument correctness 메트릭을 실행하려면 single-turn metric collection에 추가하세요. 그러면 다음에 사용할 수 있어요.
- Single-turn E2E 테스트
- Single-turn component-level 테스트
- trace와 span의 온라인 및 오프라인 eval
더 알아보기
- Tool Correctness — tool 선택 검증 메트릭
- Metric Collections — 원격 평가를 위한 메트릭 묶기