Parea 평가 퀵스타트 — 실험으로 LLM 앱 평가하기
Parea 평가 퀵스타트
LLM 앱이 실제로 좋은지 숫자로 확인하려면 평가 실험을 돌리면 돼요. Parea의 평가 퀵스타트를 따라가면 설치부터 실험 실행·결과 조회까지 볼 수 있어요.
출처: https://docs.parea.ai/welcome/getting-started-evaluation
1. 설치
Parea API 키가 필요해요. 인증을 참고해 준비한 뒤 SDK를 설치해요.
pip install parea-ai
2. 평가 스크립트 만들기
간단한 평가 스크립트부터 만들어요. @trace 데코레이터로 함수를 주석 처리하고 평가 함수를 전달해요. levenshtein은 Parea 내장 평가 함수예요.
import os
from dotenv import load_dotenv
from parea import Parea, trace
from parea.evals.general import levenshtein
load_dotenv()
p = Parea(api_key=os.getenv("PAREA_API_KEY"))
# 기능에 trace 데코레이터로 주석 달고 평가 함수를 전달
@trace(eval_funcs=[levenshtein])
def greeting(name: str) -> str:
return f"Hello {name}"
p.experiment(
"Greetings", # experiment name
data=[
{ "name": "Foo", "target": "Hi Foo" },
{ "name": "Bar", "target": "Hello Bar" },
], # test data to run the experiment on (list of dicts)
func=greeting,
).run()
3. 실험 실행
python3 path/to/experiment_file.py
4. 결과 확인
실행된 스크립트가 실험 개요와 트레이스 링크를 만들어요. 실험의 고수준 개요에서 지연·비용 같은 메트릭 평균과 정의한 평가 함수를 볼 수 있고, 로그 표는 검색·필터·정렬을 지원해요. 로그를 클릭하면 상세 트레이스 뷰에서 각 스팬의 입력·출력·메시지·메타데이터를 볼 수 있어요.
5. 100%로 올릴 수 있나요?
첫 실험에서 77.8% 점수를 얻었다면, 다른 실험을 돌려 이전 결과와 비교하며 점수를 올리는 식으로 반복해요.