데이터셋 & 실험 (Datasets & Experiments)

데이터셋 & 실험 (Datasets & Experiments)

AI 애플리케이션 개발 속도는 종종 품질 평가가 병목이 돼요. 어느 프롬프트·LLM이 성능·지연·비용을 가장 잘 균형 잡는지 고르는 것이 어려운 트레이드오프이기 때문이죠. 고품질 평가는 이런 질문에 더 큰 확신을 갖고 답하게 도와줘요. 데이터셋과 실험이 바로 그 평가를 체계적으로 돌리는 뼈대예요.

출처: Phoenix - Overview: Datasets & Experiments

데이터셋(Datasets)

데이터셋은 평가의 핵심이에요. 앱을 평가하기 위한 inputs와, 선택적으로 기대하는 reference 출력을 담은 예시 모음이에요. 프로덕션, 스테이징, 평가에서, 또는 수동으로 데이터를 모을 수 있고, 이 예시들은 프롬프트·LLM·앱의 다른 부분 개선을 추적하는 실험·평가에 사용돼요.

실험(Experiments)

AI 개발에서는 변경이 성능에 어떤 영향을 줄지 파악하기 어려워요. 이러면 개발 흐름이 끊기고, 반복이 공학보다는 추측이 되기 쉬워요. 실험과 평가는 LLM의 불확정성을 체감할 수 있는 피드백으로 압축해서 더 신뢰할 수 있는 제품을 출시하는 데 도움을 줘요. 좋은 평가는 이걸 가능하게 해줘요.

  • 변경이 개선인지 회귀인지 파악하기
  • 좋은/나쁜 예시로 드릴다운하기
  • 이전 실행과 특정 예시 비교하기
  • 추측 없애기

데이터셋 평가자(Dataset Evaluators)

데이터셋을 다룰 때, 그 데이터셋의 예시에 대해 작업 출력을 검증하는 평가자 모음을 만들어 두고 싶을 때가 있어요. 데이터셋 평가자는 실험 실행 시 출력을 자동 점수화하는 테스트 케이스 역할을 해서, 단위 테스트 스위트와 비슷한 평가 하니스(evaluation harness)를 형성해요. 예를 들어 Q&A 작업 데이터셋이 있다면 이런 평가자들을 붙일 수 있어요.

  • 출력이 기대 reference와 일치하는지(정확 매치 또는 유사도)
  • 출력이 올바른 도구를 호출하는지
  • 응답에 환각(hallucination)이 없는지
  • 출력이 기대 형식을 따르는지

데이터셋에 대해 실험을 실행하면 관련 평가자가 자동으로 실행돼, 일관되고 반복 가능한 품질 평가를 제공해요. 매번 같은 평가 기준이 적용된다는 확신 속에 프롬프트·모델·앱 로직을 반복할 수 있죠.

더 알아보기

  • 데이터셋 만들기: 예시를 수집·정리하는 방법
  • 실험 실행: 데이터셋에 대해 변경을 실행하고 결과 비교하기
  • eval CI: pytest로 평가를 CI에 통합하기