AI Connections용 Multi-Generation
AI Connections용 Multi-Generation
골든(golden)마다 AI 앱을 여러 번 샘플링해, 단일 출력이 평가 결과를 왜곡하지 않도록 하는 기능이에요.
출처: 문서
본문
개요 (Overview)
대부분의 AI 앱은 비결정적(non-deterministic)이에요. 같은 입력을 두 번 실행하면(temperature > 0이면 뭐든) 두 개의 다른 출력이 나와요. 골든마다 단일 생성(single generation)만 실행하면 앱이 그 한 번 어떻게 수행했는지만 알려주기 때문에, 단일 이상치 응답 하나가 전체 결과를 왜곡할 수 있어요.
AI Connection의 multi-generation factor(멀티 생성 계수) 가 이 문제를 해결해요. 골든마다 엔드포인트를 한 번 호출하는 대신 여러 번 호출해, 테스트 케이스마다 여러 세대(generation)를 캡처해요. 여러 출력을 살펴보면 단일 샘플을 믿는 대신 앱이 평균적으로 어떻게 수행하는지 볼 수 있어요.

Set Default Generations on your AI Connection
기본 생성 수 (Default Generations)
multi-generation factor는 AI connection의 Throttling 탭에서 Default Generations 필드로 찾을 수 있어요. 데이터셋의 각 골든에 대해 Confident AI가 엔드포인트를 몇 번 호출할지 제어해요.
- 최소: 1 (단일 생성 — 표준 동작)
- 기본값: 1
이 값을 1보다 크게 설정하면 멀티 생성 테스트 런을 활성화해요. 예를 들어 계수가 5면 골든마다 엔드포인트를 5번 호출해 테스트 케이스당 5개의 생성이 만들어져요.
생성이 하나 늘 때마다 엔드포인트로 가는 요청이 하나씩 늘어요. 골든 100개 데이터셋에 계수
5면 테스트 런당 500개의 요청이 발생해요. 계수가 높아도 AI 앱을 압도하지 않도록 Throttling & Retries를 조정하세요.
동작 방식 (How It Works)
계수가 1보다 큰 멀티 생성 평가를 실행하면, Confident AI가 다음 골든으로 넘어가기 전에 골든마다 엔드포인트를 반복 샘플링해요.
sequenceDiagram
participant You
participant Platform as Confident AI
participant App as Your AI App
You->>Platform: Run evaluation
loop For each golden in dataset
loop N generations
Platform->>App: Send input
App-->>Platform: Generation output
end
Note over Platform: Group N generations into one test case
end
Platform-->>You: Multi-generation test run
각 골든은 단일 출력의 일회성 스냅샷이 아니라, 모든 N 세대를 담은 하나의 테스트 케이스가 돼요.
멀티 생성 테스트 런 (Multi-Generation Test Runs)
이렇게 만들어진 테스트 런을 multi-generation test run(멀티 생성 테스트 런) 이라고 해요. 각 테스트 케이스가 하나 대신 여러 출력을 담기 때문에, Confident AI는 앱 점수가 세대마다 얼마나 변하는지 — 단일 출력으로는 완전히 숨겨졌을 변동성(spread)을 — 측정할 수 있어요.
멀티 생성 테스트 런에서 아무 골든을 열면 모든 세대가 나란히 보이고, 모든 샘플에서 얼마나 자주 통과했는지 요약해 주는 Consistency(일관성) 열이 표시돼요.

A multi-generation test case with each generation displayed
중요한 건 단일 통과나 실패가 아니라, 앱이 각 메트릭 임계값을 평균적으로 충족하는지예요. 그래야 단일 이상치 출력이 결과를 왜곡할 수 없어요.
- 단일 출력은 오해를 부를 수 있어요 — 통과한 응답 하나가 보통 실패하는 메트릭을 가릴 수 있고, 실패한 응답 하나가 보통 통과하는 메트릭을 가릴 수 있어요.
- 세대 간 평균이 진짜 성능을 드러내요 — Consistency 탭이 각 메트릭의 평균 점수와 변동 정도를 보여줘서, 테스트 케이스가 안정적으로 통과하는지 아니면 한 번만 임계값을 넘었는지 알 수 있어요.
세대가 많을수록 앱의 평균 동작에 대한 더 신뢰할 만한 그림을 얻지만, 각각은 엔드포인트로 가는 요청이에요. 계수
3–5정도면 요청량을 크게 늘리지 않고도 세대 간 변동을 드러내기에 충분해요.
다음 단계 (Next Steps)
멀티 생성 샘플링을 구성했으니, 그 풍부해진 테스트 런을 활용해 보세요.
Regression Testing
두 테스트 런을 나란히 비교해 AI 앱 버전 간 개선과 회귀를 파악해요.
Throttling & Retries
동시성·타임아웃·재시도를 조정해 계수가 높아도 엔드포인트를 압도하지 않게 해요.