왜 Confident AI인가(Why Confident AI)
왜 Confident AI인가(Why Confident AI)
Confident AI가 왜 여러분에게 맞는 선택인지를 이해하는 페이지예요. 지루한 수동 LLM 평가 워크플로우를 얼마나 줄여주는지, 기존 솔루션과 무엇이 다른지, 그리고 아직 다른 솔루션을 쓰고 있다면 왜 전환을 고려해 볼 만한지를 설명할게요.
출처: 문서
본문
개요
Confident AI는 LLM 애플리케이션을 테스트하기 위한 평가 우선(evaluation-first) 플랫폼이에요. 지루한 수동 LLM 평가 워크플로우의 상당 부분, 어쩌면 전부를 대체하고, 여러분이 이미 쓰고 있을 수 있는 기존 솔루션도 대체해요.
엔지니어링 팀이 Confident AI를 선택하는 몇 가지 이유:
- DeepEval 위에 구축됐어요. Confident AI의 오픈소스 LLM 평가 프레임워크이자 해당 카테고리에서 가장 많이 채택된 도구죠 (주당 1,000만+ 평가, 모든 사용 사례를 위한 50+ 지표)
- 모든 기능이 LLM 평가 워크플로우에 맞게 설계됐어요 — 지표, 데이터셋, 모델, 프롬프트를 개선할 수 있죠
- 절대 막히지 않아요 — 평가를 부수적인 것으로 취급하는 일반 플랫폼과 달리, 더 복잡한 평가를 만날 때 문제가 생기지 않도록 DeepEval 창시자들이 만들었어요
DeepEval vs Confident AI
"아, 그럼 DeepEval이 Confident AI의 가장 큰 경쟁자인가요?"
DeepEval은 오픈소스 LLM 평가 프레임워크예요. Confident AI에서 평가 결과를 채우는 데 사용되는 지표를 DeepEval이 구동하지만, 둘은 아주 다른 제품이에요.
DeepEval은 LLM을 위한 Pytest 같아요 — Python 스크립트를 통해 터미널에서 실행되고, 결과를 볼 수 있지만 그 후에는 아무 일도 일어나지 않아요.
DeepEval은 이 플랫폼을 만드는 같은 회사인 Confident AI가 만들고 유지 관리해요. Confident AI는 2023년에 DeepEval을 오픈소스로 공개했고, 그 지표 알고리즘을 소유하고 있어요.
Confident AI를 쓰면 테스트 리포트를 관리하고, 회귀(regression)를 사용자가 발견하기 전에 잡아내고, 플랫폼에서 버전 관리하는 프롬프트를 (평가 결과에 기반해) 자동 최적화하고, 프로덕션에서 LLM 상호작용을 추적·모니터링하며, 최종 사용자나 내부 리뷰어로부터 인간 피드백을 수집해 DeepEval의 LLM-as-a-judge 지표에만 의존하지 않고 더 나은 데이터 기반 결정을 내릴 수 있는 중앙화된 공간을 갖게 돼요.
| DeepEval | Confident AI |
|---|---|
| 오픈소스 | 같은 DeepEval 지표 위에, 같은 팀이 구축 |
| 로컬에서 평가 실행 | 로컬과 클라우드에서 평가 실행 |
| 데이터 영속성 & UI 없음 | 프롬프트 관리 및 A|B 테스트 |
| 테스트 리포트 공유 없음 | 데이터셋 큐레이션 및 어노테이션 |
| A|B 테스트 어려움 | 데이터 영속성과 공유 가능한 테스트 리포트 |
| 실시간 평가 없음 | 모든 조직의 이해관계자가 접근 가능 |
| 옵저버빌리티와 트레이싱 없음 | 실시간 온라인 평가와 성능 알림 |
| Red teaming은 DeepTeam에서 가능 | 트레이싱을 통한 LLM 옵저버빌리티 |
| 커뮤니티 지원 | 최종 사용자·내부 피드백 수집 |
| 이메일, 비공개, 라이브 화상 통화 지원 |
LLM 평가를 이제 막 시작하려고요?
Confident AI는 평균 10분이면 설정할 수 있어요.
아직 어떤 LLM 평가/옵저버빌리티 플랫폼도 사용하지 않은 분을 위해, Confident AI가 어떻게 최고의 LLM 애플리케이션을 만드는 데 도움을 주는지 설명할게요:
- 품질을 위한 LLM 앱 회귀 테스트
- 테스트 리포트를 분석·공유하기 위한 수동 CSV 워크플로우 제거
- 프롬프트 버전 관리와 최적화
- 데이터셋 어노테이션을 위한 스프레드시트 회피
- 엔지니어링 팀과 비엔지니어링 팀의 협업 간소화
- 프로덕션에서 LLM 앱 성능의 실시간 가시성 확보
- 프로덕션 데이터로 더 견고한 데이터셋 생성
- 사용자와 내부 리뷰어의 인간 피드백 수집
모든 기능은 평가 결과를 향상시키거나 — 더 유효한 데이터로 더 빨리 반복할 수 있게 — (모델·프롬프트 제안을 통해) LLM 애플리케이션을 직접 개선하도록 설계됐어요.
| 직접 관리 방식 | Confident AI |
|---|---|
| 출력을 수동으로 검토하는 데 쓴 시간 | 자동 테스트로 LLM 평가의 수많은 시간 절약 |
| 테스트 케이스를 계속 처음부터 재생성 | 애플리케이션과 함께 성장하는 재사용 가능한 테스트 스위트 구축 |
| 시간에 따른 품질 하락을 추적할 방법 없음 | 사용자가 발견하기 전에 품질 하락 포착 |
| 팀원과 인사이트 공유가 어려움 | 누구나 이해할 수 있는 공유 가능한 테스트 리포트 생성 |
| 모델·프롬프트 변경을 정당화하기 어려움 | 모델·프롬프트 변경에 대한 데이터 기반 결정 |
| 직접 대시보드를 구축 | 사용자 피드백을 곧바로 테스트 케이스로 전환 |
| 사용 사례에 어떤 모델·프롬프트가 가장 잘 맞는지 정확히 파악 | |
| 철저히 테스트됐다는 확신을 갖고 LLM 기능 출시 | |
| 배포 전에 환각(hallucination) 탐지 및 수정 | |
| 이해관계자에게 LLM 성능 개선의 명확한 증거 제시 |
이미 다른 솔루션을 쓰고 있다면?
Confident AI가 더 적합하다고 결정했다면, 전환은 아주 쉬운 과정이에요. 사용자들이 우리로 전환하는 일반적인 이유:
- 쓰고 있는 도구가 (말 그대로) 동작하지 않음
- 공급업체가 연간 계약을 강요하려 함
- 평가 기능이 최소한임 (제한된 지표, 챗봇·에이전트 지원 부족 등)
- 비기술 팀원(테스트 데이터를 검토해야 하는 도메인 전문가, 외부 이해관계자, 법무·컴플라이언스 담당자)의 워크플로우를 다루지 못함
- 안전 테스트 기능(red teaming, 가드레일)도 있는 올인원 솔루션을 원함
- 고객 지원에 대한 불만
- 우리 문서 읽는 게 더 좋아서 😉
[!NOTE]
사용자들이 Confident AI로 전환하며 가장 많이 나오는 기존 솔루션은 Arize AI, Langsmith, Galileo, Braintrust예요.
반대로, 쓰고 있는 도구가 완벽하게 동작할 때도 있어요. 어떤 평가 요구는 LLM 옵저버빌리티 우선 솔루션으로도 충족될 수 있다는 게 사실이에요. 하지만 LLM 시스템이 성숙해짐에 따라, 테스트 커버리지 부족, 신뢰할 수 없는 지표, 더 많은 LLM 평가 요구로의 확장 같은 문제가 드러나기 시작해요. 특히 평가를 전문으로 하지 않고 자기 평가 알고리즘을 소유하지 않는 도구라면요.
Confident AI는 DeepEval에서 시작했어요. 즉 여러분이 어떤 지표를 선택하든 그것이 시중 최고라는 걸 확실히 알 수 있어요.
마주하게 될 일반적인 문제:
- 부실한 LLM 테스트 커버리지
- 반복 가능하지 않고 커스터마이징 경로가 명확하지 않은 "LLM-as-a-judge" 지표
- 편향, PII 유출, 허위 정보 같은 것에 대한 안전 테스트(red teaming과 가드레일)로 확장하지 못함
- LLM 평가에 대한 명확한 소유권·전문성이 없어 평가 전략 수립 같은 단순한 일조차 혼자 감당해야 함
Confident AI는 DeepEval 창시자들이 만들었어요. 그래서 일반 목적 플랫폼과 달리, 어떤 병목도 마주하지 않도록 돕기 위해 여기 있는 거예요.
| 다른 솔루션 | Confident AI |
|---|---|
| LLM 특화 문제를 놓치는 일반 지표 | 사용자가 실제로 신경 쓰는 문제를 잡아내는 목적 특화 지표 |
| 사용 사례에 대한 제한된 이해 | DeepEval 팀의 평가 전문성 (주당 1,000만+ 평가) |
| LLM 위험에 대한 최소한의 보호 | 브랜드와 사용자를 보호하는 종합적인 안전 테스트 |
| 평가 전략을 혼자 세우게 놔둠 | 모든 것을 본 전문가의 가이드 평가 전략 |
| 팀 전체의 워크플로우를 위해 만들어지지 않음 | 엔지니어와 비기술 팀원 모두 더 나은 결정을 내리도록 지원 |
| 실제 사용자 데이터에 기반한 프롬프트 개선의 명확한 경로 | |
| LLM 애플리케이션을 테스트·모니터링·개선하는 하나의 공간 | |
| 특정 요구에 가장 잘 맞는 모델에 대한 맞춤 조언 |