노코드 평가 퀵스타트

노코드 평가 퀵스타트 (No-Code Evals Quickstart)

Confident AI 플랫폼 UI에서 코드 없이 첫 번째 평가를 실행해볼게요. 메트릭 컬렉션을 만들고, 골든스가 담긴 데이터셋을 구축한 뒤, 평가를 실행해 대시보드에서 결과를 확인하게 돼요. 비기술적인 팀원도 Confident AI를 벗어나지 않고 AI 앱의 종단 간 반복을 돌릴 수 있는 워크플로우예요.

출처: 문서

본문

개요

이 퀵스타트는 Confident AI에서 첫 번째 노코드 평가를 실행하는 과정을 안내해요. 마치면 다음을 갖게 됩니다:

  • 무엇을 평가할지 정의하는 메트릭 컬렉션(metric collection) 생성
  • 골든스가 담긴 데이터셋 구축
  • 평가 실행 및 대시보드에서 결과 확인

노코드 평가 워크플로우는 비기술적인 팀원도 Confident AI를 벗어나지 않고 AI 앱의 종단 간 반복을 실행하게 해줘요.

따라 하려면 Confident AI 계정이 필요해요. 아직 없다면 여기서 가입하세요.

첫 번째 평가 실행하기

싱글턴, QA 유스케이스 예시를 따라 첫 번째 평가를 실행해볼게요:

메트릭 컬렉션 만들기

메트릭 컬렉션은 함께 평가하려는 메트릭들을 묶어줘요.

Video

메트릭 컬렉션 만들기

  1. 사이드바에서 Metric Collections로 이동
  2. Create Metric Collection 클릭
  3. 이름 지정 (예: "RAG Quality Metrics")
  4. 포함할 메트릭 선택:
    • Answer Relevancy — 아웃풋이 인풋을 다루는지 측정
    • Faithfulness — 아웃풋이 컨텍스트에 근거하는지 측정
    • 유스케이스에 관련된 다른 메트릭 추가
  5. Save 클릭

첫 평가에서는 메트릭 2~3개로 시작하세요. 나중에 언제든 추가할 수 있어요.

데이터셋 만들기

데이터셋에는 AI 아웃풋을 생성하는 데 사용할 골든스가 담겨요.

Video

골든스로 데이터셋 만들기

  1. 사이드바에서 Datasets로 이동
  2. Create Dataset 클릭
  3. 이름 지정 (예: "QA Test Cases")
  4. 골든스 추가:
    • Input: 유저 쿼리 (예: "What is the refund policy?")
    • Expected Output (선택): 이상적인 응답
    • Actual Output: 평가할 AI 앱의 아웃풋
  5. Save 클릭

AI 아웃풋을 생성하는 모든 방법은 이후 섹션에서 다룰게요.

이 퀵스타트에서는 하드코딩된 actual output을 제공해요(걱정 마세요, 나중에는 이렇게 하지 않을 거예요):

필드 예시 값
Input "What is the refund policy?"
Actual Output "You can request a refund within 30 days of purchase by contacting support."

평가 실행

이제 골든스를 메트릭에 대해 평가해볼게요.

  1. 개별 데이터셋 페이지에서 Evaluate 버튼 클릭
  2. Metric Collection 선택 (예: "Agentic Quality Metrics")
  3. Run Evaluation 클릭

평가는 각 테스트 케이스를 처리하고 선택한 메트릭에 대해 점수를 매겨요.

대시보드에서 결과 확인

평가를 실행하면 테스트 런(test run)으로 리다이렉트돼요. 평가 완료를 잠시 기다리면 ✅ 완료! 첫 번째 노코드 평가를 실행한 거예요.

Video

테스트 런 결과 확인

테스팅 리포트에서 다음을 분석할 수 있어요:

  • 개별 테스트 케이스 — 특정 실패를 드릴다운해 무엇이 잘못됐는지 이해
  • 점수 분포 — 각 메트릭의 평균, 중앙값, 백분위 분포 확인
  • 통과/실패 결과 — 테스트 케이스는 모든 메트릭이 임계값을 충족할 때만 통과
  • AI 생성 요약 — 테스트 런 전체의 패턴과 이슈에 대한 자동 분석 제공

이후 섹션에서 테스트 런이 제공하는 것들을 더 자세히 알아볼 수 있어요.

AI 아웃풋 생성

위 퀵스타트에서는 데이터셋에 actual output을 하드코딩했어요. 빠른 테스트에는 유용하지만 권장되지는 않아요. 이유는 미리 계산된 정적 아웃풋이 아니라, AI 앱에 가한 변경 사항을 테스트하는 게 목표여야 하기 때문이에요.

Confident AI는 아웃풋을 동적으로 생성하는 더 강력한 방법을 제공해요:

  1. 싱글 프롬프트 생성 — 플랫폼에서 프롬프트 템플릿을 정의하면 Confident AI가 설정된 LLM 프로바이더를 호출해 아웃풋을 자동 생성해요. 프롬프트 변형 테스트나 모델 비교에 이상적이에요.

  2. AI 연결 (AI Connections) — 배포된 실제 AI 시스템에 직접 연결해요. HTTP(s)로 접근 가능하면 테스트할 수 있어요. 요청 페이로드를 커스터마이즈하고, 커스텀 응답 구조를 파싱하며, 헤더나 인증 토큰을 전달할 수 있어요.

AI 연결은 Confident AI가 AI 앱을 있는 그대로 테스트하게 해주기 때문에 강력해요. 다만 엔지니어링 쪽에서 초기 소규모 설정 시간이 필요해요.

AI 연결은 실제 AI 시스템을 종단 간 테스트하게 해주며, 프롬프트 전용 테스트가 놓치는 통합 이슈를 잡아내요.

다음 단계

기본 평가를 마쳤으니, 다양한 유스케이스를 다루는 방법을 배워볼게요:

싱글턴 평가 (Single-Turn Evals)

생성된 아웃풋으로 원샷(one-shot) Q&A, 요약, 분류 작업을 평가해요.

멀티턴 평가 (Multi-Turn Evals)

여러 교환에 걸쳐 컨텍스트가 쌓이는 대화형 AI를 평가해요.

더 알아보기