Parea 평가 퀵스타트 — 실험으로 LLM 앱 평가하기

Parea 평가 퀵스타트

LLM 앱이 실제로 좋은지 숫자로 확인하려면 평가 실험을 돌리면 돼요. Parea의 평가 퀵스타트를 따라가면 설치부터 실험 실행·결과 조회까지 볼 수 있어요.

출처: https://docs.parea.ai/welcome/getting-started-evaluation

1. 설치

Parea API 키가 필요해요. 인증을 참고해 준비한 뒤 SDK를 설치해요.

pip install parea-ai

2. 평가 스크립트 만들기

간단한 평가 스크립트부터 만들어요. @trace 데코레이터로 함수를 주석 처리하고 평가 함수를 전달해요. levenshtein은 Parea 내장 평가 함수예요.

import os

from dotenv import load_dotenv

from parea import Parea, trace
from parea.evals.general import levenshtein

load_dotenv()

p = Parea(api_key=os.getenv("PAREA_API_KEY"))


# 기능에 trace 데코레이터로 주석 달고 평가 함수를 전달
@trace(eval_funcs=[levenshtein])
def greeting(name: str) -> str:
    return f"Hello {name}"

p.experiment(
    "Greetings",  # experiment name
    data=[
        { "name": "Foo", "target": "Hi Foo" },
        { "name": "Bar", "target": "Hello Bar" },
    ],  # test data to run the experiment on (list of dicts)
    func=greeting,
).run()

3. 실험 실행

python3 path/to/experiment_file.py

4. 결과 확인

실행된 스크립트가 실험 개요와 트레이스 링크를 만들어요. 실험의 고수준 개요에서 지연·비용 같은 메트릭 평균과 정의한 평가 함수를 볼 수 있고, 로그 표는 검색·필터·정렬을 지원해요. 로그를 클릭하면 상세 트레이스 뷰에서 각 스팬의 입력·출력·메시지·메타데이터를 볼 수 있어요.

5. 100%로 올릴 수 있나요?

첫 실험에서 77.8% 점수를 얻었다면, 다른 실험을 돌려 이전 결과와 비교하며 점수를 올리는 식으로 반복해요.

더 알아보기