AI Connections용 Multi-Generation

AI Connections용 Multi-Generation

골든(golden)마다 AI 앱을 여러 번 샘플링해, 단일 출력이 평가 결과를 왜곡하지 않도록 하는 기능이에요.

출처: 문서

본문

개요 (Overview)

대부분의 AI 앱은 비결정적(non-deterministic)이에요. 같은 입력을 두 번 실행하면(temperature > 0이면 뭐든) 두 개의 다른 출력이 나와요. 골든마다 단일 생성(single generation)만 실행하면 앱이 그 한 번 어떻게 수행했는지만 알려주기 때문에, 단일 이상치 응답 하나가 전체 결과를 왜곡할 수 있어요.

AI Connection의 multi-generation factor(멀티 생성 계수) 가 이 문제를 해결해요. 골든마다 엔드포인트를 한 번 호출하는 대신 여러 번 호출해, 테스트 케이스마다 여러 세대(generation)를 캡처해요. 여러 출력을 살펴보면 단일 샘플을 믿는 대신 앱이 평균적으로 어떻게 수행하는지 볼 수 있어요.

Set Default Generations on your AI Connection

기본 생성 수 (Default Generations)

multi-generation factor는 AI connection의 Throttling 탭에서 Default Generations 필드로 찾을 수 있어요. 데이터셋의 각 골든에 대해 Confident AI가 엔드포인트를 몇 번 호출할지 제어해요.

  • 최소: 1 (단일 생성 — 표준 동작)
  • 기본값: 1

이 값을 1보다 크게 설정하면 멀티 생성 테스트 런을 활성화해요. 예를 들어 계수가 5면 골든마다 엔드포인트를 5번 호출해 테스트 케이스당 5개의 생성이 만들어져요.

생성이 하나 늘 때마다 엔드포인트로 가는 요청이 하나씩 늘어요. 골든 100개 데이터셋에 계수 5면 테스트 런당 500개의 요청이 발생해요. 계수가 높아도 AI 앱을 압도하지 않도록 Throttling & Retries를 조정하세요.

동작 방식 (How It Works)

계수가 1보다 큰 멀티 생성 평가를 실행하면, Confident AI가 다음 골든으로 넘어가기 전에 골든마다 엔드포인트를 반복 샘플링해요.

sequenceDiagram
    participant You
    participant Platform as Confident AI
    participant App as Your AI App

    You->>Platform: Run evaluation

    loop For each golden in dataset
        loop N generations
            Platform->>App: Send input
            App-->>Platform: Generation output
        end
        Note over Platform: Group N generations into one test case
    end

    Platform-->>You: Multi-generation test run

각 골든은 단일 출력의 일회성 스냅샷이 아니라, 모든 N 세대를 담은 하나의 테스트 케이스가 돼요.

멀티 생성 테스트 런 (Multi-Generation Test Runs)

이렇게 만들어진 테스트 런을 multi-generation test run(멀티 생성 테스트 런) 이라고 해요. 각 테스트 케이스가 하나 대신 여러 출력을 담기 때문에, Confident AI는 앱 점수가 세대마다 얼마나 변하는지 — 단일 출력으로는 완전히 숨겨졌을 변동성(spread)을 — 측정할 수 있어요.

멀티 생성 테스트 런에서 아무 골든을 열면 모든 세대가 나란히 보이고, 모든 샘플에서 얼마나 자주 통과했는지 요약해 주는 Consistency(일관성) 열이 표시돼요.

A multi-generation test case with each generation displayed

중요한 건 단일 통과나 실패가 아니라, 앱이 각 메트릭 임계값을 평균적으로 충족하는지예요. 그래야 단일 이상치 출력이 결과를 왜곡할 수 없어요.

  • 단일 출력은 오해를 부를 수 있어요 — 통과한 응답 하나가 보통 실패하는 메트릭을 가릴 수 있고, 실패한 응답 하나가 보통 통과하는 메트릭을 가릴 수 있어요.
  • 세대 간 평균이 진짜 성능을 드러내요 — Consistency 탭이 각 메트릭의 평균 점수와 변동 정도를 보여줘서, 테스트 케이스가 안정적으로 통과하는지 아니면 한 번만 임계값을 넘었는지 알 수 있어요.

세대가 많을수록 앱의 평균 동작에 대한 더 신뢰할 만한 그림을 얻지만, 각각은 엔드포인트로 가는 요청이에요. 계수 3–5 정도면 요청량을 크게 늘리지 않고도 세대 간 변동을 드러내기에 충분해요.

다음 단계 (Next Steps)

멀티 생성 샘플링을 구성했으니, 그 풍부해진 테스트 런을 활용해 보세요.

Regression Testing

두 테스트 런을 나란히 비교해 AI 앱 버전 간 개선과 회귀를 파악해요.

Throttling & Retries

동시성·타임아웃·재시도를 조정해 계수가 높아도 엔드포인트를 압도하지 않게 해요.

더 알아보기 (Learn more)