LLM-as-a-Judge — 모델이 모델을 평가한다
LLM-as-a-Judge
답변 품질을 사람이 일일이 채점하는 건 비싸고 느려요. LLM-as-a-judge 는 강력한 LLM에게 평가 기준을 주고 다른 모델의 응답을 채점·비교하게 하는 기법이에요. OpenAI Evals, LangSmith, LlamaIndex가 대표 도구예요.
이 카테고리의 문서
- 개요: OpenAI Evals — 공식 평가 프레임워크
- 핵심 기능: LangSmith — LLM-as-judge 평가기(evaluator)
- 실전·API: LlamaIndex — 파이프라인 품질 평가