에이전트 워크플로우 평가하기
에이전트 워크플로우 평가하기
에이전트가 일관되고 정확하게 동작하는지 보장하기 위한 평가 도구 모음을 소개해요. 트레이스 그레이딩으로 시작해 데이터셋과 eval 실행으로 확장하는 흐름을 배워요.
출처: 문서
본문
OpenAI Platform은 에이전트가 일관되고 정확하게 수행되도록 돕는 일련의 평가 도구를 제공해요.
에이전트 워크플로우에서 가장 중요한 평가 표면(evaluation surfaces)을 결정하는 판단 지점으로 이 페이지를 사용하세요.
아직 동작을 디버깅 중일 때는 트레이스로 시작하세요
트레이스 그레이딩(trace grading)은 워크플로우 수준 문제를 식별하는 가장 빠른 방법이에요. 트레이스(trace)는 한 번 실행에 대한 모델 호출, 도구 호출, 가드레일, 핸드오프의 종단 간(end-to-end) 기록을 담아요. 그레이더(graders)를 사용하면 구조화된 기준으로 그 트레이스에 점수를 매겨 대규모로 회귀와 실패 모드를 찾을 수 있어요.
다음과 같은 질문에 답하고 싶을 때 트레이스 그레이딩을 사용하세요:
- 에이전트가 올바른 도구를 골랐나요?
- 핸드오프가 되어야 할 때 이루어졌나요?
- 워크플로우가 지침이나 안전 정책을 위반했나요?
- 프롬프트나 라우팅 변경이 종단 간 동작을 개선했나요?
트레이스 그레이딩 워크플로우
- 대시보드에서 Logs > Traces를 엽니다.
- SDK 기반 앱의 대표 워크플로우 트레이스, 또는 전환 기간 동안 기존 Agent Builder 워크플로우의 트레이스를 검사합니다.
- 그레이더를 만들고 선택한 트레이스에 대해 실행합니다.
- 결과를 사용해 프롬프트, 도구 표면, 라우팅 로직 또는 가드레일을 개선합니다.
코드 우선(code-first) SDK 워크플로우의 경우, 그레이더를 공식화하기 전에 신호가 강한 트레이스를 얻으려면 Integrations and observability부터 시작하세요.
반복 가능성이 필요할 때는 데이터셋과 eval 실행으로 이동하세요
"좋음(good)"이 무엇인지 알게 되면 개별 트레이스에서 반복 가능한 데이터셋과 eval 실행으로 이동하세요. 변경 사항을 벤치마킹하고, 프롬프트를 비교하거나, 시간이 지남에 따라 더 큰 규모의 평가를 실행하고 싶을 때 이 단계가 적절해요.
외부 모델에 대한 평가, 평가 API, 더 큰 규모의 배치 평가 같은 고급 기능이 필요하다면, 데이터셋과 함께 Evals를 사용하세요.
관련 평가 표면
[Getting started with evals: Datasets
Operate a flywheel of continuous improvement using evaluations.](https://developers.openai.com/api/docs/guides/evaluation-getting-started)
[Working with evals
Evaluate against external models, interact with evals via API, and more.](https://developers.openai.com/api/docs/guides/evals)
[Prompt optimizer
Use your dataset to automatically improve your prompts.](https://developers.openai.com/api/docs/guides/prompt-optimizer)
[Cookbook: Building resilient prompts with evals
Operate a flywheel of continuous improvement using evaluations.](https://developers.openai.com/cookbook/examples/evaluation/building_resilient_prompts_using_an_evaluation_flywheel)