멀티턴 평가

멀티턴 평가 (Multi-Turn Evals, 노코드)

여러 교환에 걸쳐 컨텍스트가 쌓이는 대화형 AI를 평가해볼게요. 싱글턴과 달리 멀티턴은 메트릭을 적용하기 전에 전체 대화를 먼저 생성해야 한다는 점이 핵심이에요. 다행히 Confident AI가 시뮬레이션까지 처리해주니, 몇 시간씩 AI를 수동으로 프롬프트할 필요가 없어요.

출처: 문서

본문

개요

멀티턴 평가는 여러 교환에 걸쳐 컨텍스트가 축적되는 대화형 상호작용을 테스트해요. AI가 대화 내내 일관성을 유지해야 하는 유스케이스가 대상이에요:

  • 챗봇 — 고객 지원, 세일즈 어시스턴트, 또는 범용 채팅
  • 대화형 에이전트 — 왕복이 있는 멀티스텝 작업 완료
  • 에이전틱 시스템 — 턴을 넘나들며 툴 콜과 추론이 있는 복잡한 워크플로우

싱글턴 평가와 달리 멀티턴 평가는 메트릭을 적용하기 전에 전체 대화를 생성해야 하며, 이는 과정에서 가장 시간이 걸리는 부분이에요.

다행히 Confident AI가 시뮬레이션 측면도 처리해줘서 몇 시간 동안 AI를 수동으로 프롬프트하지 않아도 돼요.

요구 사항

멀티턴 평가를 실행하려면 다음이 필요해요:

  1. 멀티턴 데이터셋 — 대화 스타터 또는 전체 대화 히스토리를 가진 골든스
  2. 멀티턴 메트릭 컬렉션 — 대화형 평가를 위해 설계된 메트릭

멀티턴 메트릭은 개별 메시지가 아니라 대화 전체를 평가해요. 예로는 turn faithfulness와 turn contextual relevancy가 있어요.

동작 방식

멀티턴 평가는 5단계 과정을 따라요 — 싱글턴과의 핵심 차이는 시뮬레이션 단계예요:

  1. 메트릭 정의 — 대화형 메트릭 선택 (예: turn relevancy, conversation completeness)
  2. 데이터셋 생성 — 대화 스타터로 골든스 구축
  3. 아웃풋 생성 구성 — AI 연결 또는 프롬프트 설정
  4. 대화 시뮬레이션 — 유저 턴을 시뮬레이션해 전체 대화 생성
  5. 평가 — 완성된 대화에 메트릭 실행

데이터 흐름을 시각적으로 보면:

sequenceDiagram
    participant User as You
    participant Platform as Confident AI
    participant AI as Your AI App
    participant Sim as User Simulator
    participant Metrics as Metric Collection

    User->>Platform: Start Evaluation

    loop For each golden in dataset
        loop Simulate conversation
            Platform->>AI: Send user message
            AI-->>Platform: AI response
            Platform->>Sim: Generate next user turn
            Sim-->>Platform: Simulated user message
        end
        Platform->>Metrics: Run metrics on conversation
        Metrics-->>Platform: Metric scores
    end

    Platform-->>User: Test Run Produced
    Note over User,Platform: View results on Dashboard

평가 전에 대화를 완전히 시뮬레이션해야 하므로 멀티턴 평가는 싱글턴보다 약간 오래 걸릴 수 있어요. 큰 데이터셋은 이에 맞춰 계획하세요.

시뮬레이션 제어하기

데이터셋 내 시뮬레이션을 제어하려면 goldens의 scenario, expected outcome, user description 필드를 편집해야 해요. 각 필드는 시뮬레이션을 서로 다른 방식으로 제어해요:

  • Scenario — 대화의 컨텍스트와 주제를 설정하며, 시뮬레이션된 유저가 무엇을 논의하고 어떤 상황에 있는지 안내해요 (예: "유저가 다음 주말 파리행 항공편을 예약하려고 함")
  • Expected outcome — 시뮬레이션이 성공적으로 끝나기 위해 달성해야 할 목표를 정의해요 (예: "유저가 항공편 예약에 성공함" 또는 "유저가 환불 확인을 받음")
  • User description — 대화 내내 시뮬레이션된 유저의 페르소나, 톤, 행동을 형성해요 (예: "참을성이 없고 짧고 직접적인 질문을 하는 불만 고객")

중요한 점은, 시뮬레이션된 최대 유저 턴 수 이후에도 expected outcome을 달성하지 못하면 시뮬레이션이 자동으로 끝난다는 거예요. 이는 멀티턴 데이터셋의 드롭다운 설정에서 구성할 수 있어요.

평가 실행하기

데이터셋 페이지 오른쪽 위의 Evaluate 버튼을 클릭해 데이터셋을 평가할 수 있어요.

멀티턴 데이터셋의 Evaluate 버튼

데이터셋과 메트릭 선택

  1. Project > Datasets로 이동해 평가할 멀티턴 데이터셋 선택
  2. Evaluate 클릭
  3. 멀티턴 메트릭 컬렉션 선택

시뮬레이션 켜기

평가 시점에 AI 앱을 호출하려면 이 옵션을 활성화해야 해요

잘 짜여진 시뮬레이션 지침이 현실적인 대화의 핵심이에요. 골든스의 scenario, expected outcome, user description 필드를 통해 유저의 목표, 톤, 지식 수준을 구체적으로 정하세요.

아웃풋 생성 구성

시뮬레이션이 켜져 있다면, AI 앱이 각 턴에 어떻게 응답할지 선택해요:

프롬프트 (Prompt)

멀티턴 평가를 위한 프롬프트 구성

프롬프트 기반 챗봇의 경우 대화 기록을 포함하는 프롬프트 템플릿을 선택해요.

  1. 평가 설정에서 이 프롬프트를 아웃풋 생성 방식으로 선택
  2. Confident AI가 각 턴마다 LLM을 호출하며 대화 기록을 전달

이 기능이 동작하려면 기존 프롬프트가 필요해요. 아직 없다면 Prompt Studio에서 프롬프트를 만들 수 있어요.

AI 연결 (AI Connection)

멀티턴 평가를 위한 AI 연결 구성

배포된 대화형 시스템의 경우 Confident AI를 HTTP 엔드포인트에 직접 연결해요.

  1. Settings → AI Connections로 이동해 연결 생성
  2. 요청 페이로드가 대화 기록을 수용하도록 엔드포인트 구성
  3. 평가 설정에서 이 AI 연결을 아웃풋 생성 방식으로 선택

이 기능이 동작하려면 기존 AI 연결이 필요해요. 아직 없다면 프로젝트 설정에서 AI 연결을 만들 수 있어요.

실행 및 결과 확인

Run Evaluation을 클릭하고 시뮬레이션이 완료될 때까지 기다려요. 대화 생성 단계 때문에 싱글턴 평가보다 오래 걸릴 수 있어요.

테스트 런 대시보드가 다음을 보여줘요:

  • 점수 분포 — 각 메트릭의 평균, 중앙값, 백분위
  • 통과/실패 결과 — 모든 메트릭이 임계값을 충족할 때만 대화 통과
  • 전체 대화 로그 — 완전한 시뮬레이션된 대화 검토
  • 턴별 분석 — 각 단계에서 AI가 어떻게 수행했는지 확인

Video

멀티턴 테스트 런 결과

회귀 테스트 (Regression Testing)

테스트 런이 두 개 이상 있으면 나란히 비교해 회귀를 식별할 수 있어요.

회귀 테스트 열기

  1. 테스트 런의 A|B Regression Test 탭으로 이동
  2. New Regression Test 클릭
  3. 비교할 테스트 런 선택

회귀 분석

비교 보기는 다음을 강조해요:

  • 회귀(Regressions) (빨강) — 더 나빠진 대화
  • 개선(Improvements) (초록) — 더 좋아진 대화
  • 나란히 보는 점수 — 런 간 메트릭 비교

Video

A|B 회귀 테스트

다음 단계

싱글턴 평가 (Single-Turn Evals)

원샷 Q&A, 요약, 분류 작업을 평가해요.

Arena

프롬프트와 모델을 실시간으로 나란히 비교해요.

더 알아보기