Prompt flow 실행·평가 — 배치 런 만들기
Prompt flow 실행·평가
작은 데이터로 flow를 테스트했다면, 이제 더 큰 데이터셋으로 배치 런을 돌리고 평가 플로우로 품질을 측정할 차례예요. 문서의 web-classification 예제를 따라가 볼게요.
배치 런 만들기
pf run create로 flow와 데이터를 지정해 실행해요. --stream을 붙이면 실행을 스트리밍하고, --name my_first_run으로 이름을 줄 수 있어요.
pf run create --flow standard/web-classification --data standard/web-classification/data.jsonl --column-mapping url='${data.url}' --stream
--column-mapping은 flow 입력 이름에서 특정 값으로의 매핑이에요. 런 결과는 로컬 DB에 기록되어 pf run list로 언제든 볼 수 있고, 세부는 아래처럼 확인해요.
pf run show-details -n my_first_run
pf run visualize -n my_first_run
평가 플로우로 평가하기
평가 플로우는 정확도·관련성 점수 같은 메트릭을 계산하는 flow예요. 아래는 분류 시스템 성능을 평가하는 eval-classification-accuracy flow로, 예측과 정답(groundtruth)을 비교해 Correct/Incorrect를 매기고 정확도를 집계해요.
pf run create --flow evaluation/eval-classification-accuracy --data standard/web-classification/data.jsonl --column-mapping groundtruth='${data.answer}' prediction='${run.outputs.category}' --run my_first_run --stream
--run my_first_run(평가 대상 런 이름)과 --column-mapping(groundtruth·prediction 값 매핑)이 핵심 인자예요. 두 런을 동시에 시각화하고 싶으면 pf run visualize -n "my_first_run,my_first_eval_run"으로 해요.