OpenAI Evals — 자동 평가 프레임워크
OpenAI Evals — 자동 평가 프레임워크
OpenAI Evals는 LLM 애플리케이션의 성능을 자동으로 평가하는 프레임워크예요. 모델 변경이나 프롬프트 수정이 성능에 어떤 영향을 주는지 데이터로 확인하게 해줘요.
어떤 식으로 평가하나요
- 데이터셋 구성: 기대 답변을 포함한 평가용 입력들을 준비해요.
- 그레이더(grader): 응답이 기대치에 맞는지를 판단해요. 단순 문자열 비교부터
model_graded_quality같은 모델 기반 판정까지 단계가 다양해요. - LLM-as-judge: 사람이 채점 규칙을 정의하면 그 기준으로 평가 LLM이 답변을 점수화해요.
왜 LLM을 심판으로 쓰나요
정성적 기준(명확성, 일관성, 도움됨)은 규칙 기반으로 측정하기 어려워요. 강력한 LLM에 그 기준을 주면 자연어로 근사할 수 있어요. 다만 편향(길이 선호, 자기모델 선호)이 있을 수 있어 주의해야 해요.
실행
pip install openai-evals 로 설치해 평가 스크립트를 돌리면 각 샘플의 합격/불합격과 요약 통계가 나와요. 회귀(성능 하락)를 조기에 잡는 회귀 테스트로도 자주 써요.