LLM 평가 빠른 시작
LLM 평가 빠른 시작
Evidently를 처음 쓸 때 가장 많이 하는 일이 LLM 시스템 출력의 품질을 평가하는 거예요. RAG(검색 증강 생성) 파이프라인이나 에이전트의 답변을 대상으로, 정답과 비교하거나 LLM-as-a-judge 방식으로 평가할 수 있어요.
설치는 간단해요. 파이썬 환경에서 pip 명령 하나로 끝나요.
pip install evidently
LLM 평가가 다루는 것
Evidently의 LLM 평가는 단순히 "맞고 틀렸다"를 넘어서요. 생성형 출력에 대한 다양한 메트릭을 제공하죠.
- 정답 유사성: 생성된 답변과 레퍼런스 정답이 얼마나 가까운지
- 환각(hallucination) 지표: 답변이 주어진 컨텍스트에 근거하는지
- LLM-as-a-judge: 판정용 LLM으로 품질을 채점하는 방식
- 기타 생성 품질 지표: 관련성, 충실도, 유용성 등
이런 평가를 코드로 실행하면 리포트(Report)나 테스트 스위트(Test Suite) 형태로 결과를 얻어요. 라이브러리를 독립 실행으로 쓰면 노트북에서 바로 확인하고, 플랫폼을 쓰면 프로덕션의 평가 결과를 누적해서 관리해요.
평가 실행 흐름
평가를 실행하는 일반적인 흐름은 이렇게 정리돼요.
- 평가 데이터를 준비해요. (프롬프트·컨텍스트·답변·레퍼런스 등)
- 평가할 메트릭(또는 LLM 판정자)을 선택해요.
- 리포트를 만들어 메트릭 계산을 실행해요.
- 결과를 저장하거나 테스트로 전환해 CI에 연결해요.
quickstart_llm 페이지에서 주피터 노트북으로 한 번에 돌려볼 수 있는 예제를 제공하니, 처음엔 그 예제를 그대로 실행해 보는 걸 추천해요.