Maxim 첫 평가 실행 — 모델·프롬프트·데이터 준비

Maxim 첫 평가 실행

Maxim에서 첫 평가 런을 시작하는 흐름을 볼게요. 핵심은 모델 프로바이더 설정 → 프롬프트(또는 에이전트 엔드포인트) 생성 → 데이터셋 준비 → 테스트 런 실행 순서예요.

사전 준비

  • 모델 프로바이더 설정 — 평가에 쓸 LLM 프로바이더(OpenAI·Anthropic·Bedrock·Mistral 등)와 API 키를 Maxim에 연결해요.
  • 프롬프트 또는 에이전트 엔드포인트 — 온라인 상태의 HTTP 엔드포인트 에이전트 또는 Maxim에 버전화된 프롬프트를 대상으로 삼아요.
  • 데이터셋 준비 — 테스트 케이스(입력·기대 출력 포함)를 가진 데이터셋을 만들어요.

테스트 런 실행

준비가 끝나면 UI나 SDK로 테스트 런을 실행해요. 각 테스트 케이스에 대해 이벨류에이터가 점수를 계산하고, 결과는 데이터셋·기대값과 함께 대시보드에 집계돼요. 여기서 어느 케이스가 잘 되고 어디가 개선 필요한지 한눈에 보여요.

평가 리포트

런 완료 후 커스텀 리포트로 성과를 정리할 수 있고, 프로덕션 배포 전 회귀(regression) 여부를 판단하는 자료가 돼요.

더 알아보기