LLM 평가 소개
LLM 평가 소개 (Introduction to LLM Evaluation)
Confident AI에서 LLM 평가는 배포 전(pre-deployment) 환경에서 데이터셋을 통한 벤치마킹을 뜻해요. 코드 없이 하는 방식과 코드로 하는 방식, 두 가지 중 팀에 맞는 워크플로우를 고를 수 있어요. 두 방식은 같은 평가 메트릭과 인사이트를 제공하니, 차이는 '어떻게 실행하느냐'에 있어요.
출처: 문서
본문
개요
Confident AI의 LLM 평가는 배포 전 환경에서 데이터셋을 통한 벤치마킹을 의미하며, 두 가지 방식으로 수행할 수 있어요:
- 노코드(No-code) — 플랫폼 UI에서 직접 진행. QA, PM, SME(도메인 전문가)에게 가장 적합해요
- 코드 기반(Code-driven) —
deepeval프레임워크 사용. 엔지니어와 QA에게 가장 적합해요
두 방식 모두 동일한 포괄적인 평가 메트릭과 인사이트에 접근할 수 있어요 — 차이는 실행 방식에만 있죠.
관측 데이터에 대한 **온라인 평가(프로덕션 모니터링용)**를 찾고 있다면 여기를 클릭하세요.
평가할 수 있는 것
코드 기반 방식과 노코드 방식 모두 다음 3가지 유스케이스를 평가할 수 있어요:
싱글턴 (Single-Turn)
Q&A, 요약, 분류 작업처럼 하나의 인풋 → 하나의 아웃풋 형태의 상호작용이에요.
멀티턴 (Multi-Turn)
여러 차례의 대화에서 컨텍스트가 쌓여가는 대화형 상호작용이에요.
에이전틱 워크플로우 (Agentic Workflows)
툴 콜(tool calls), 추론 체인(reasoning chains), 멀티스텝 실행을 포함하는 복잡한 시스템이에요.
워크플로우 선택하기
코드를 전혀 쓰지 않고 플랫폼 UI에서 평가를 실행하거나, deepeval을 프로그래밍 방식으로 사용할 수 있어요:
노코드 평가 (No-Code Evals)
- 싱글 프롬프트·멀티 프롬프트 AI 앱에서 실험을 실행해요
- Arena에서 프롬프트와 모델을 비교해요
적합한 대상: PM, QA 팀, 빠른 프로토타이핑
코드 기반 평가 (Code-Driven Evals)
- CI/CD에서 자동화된 회귀 테스트(regression testing)를 수행해요
- 아웃풋 생성을 완전히 제어해요
- 버전 관리되는 평가 로직을 사용해요
적합한 대상: 엔지니어, 자동화 테스트
어느 쪽을 골라야 할지 모르겠다면?
대부분의 팀은 두 방식 모두 사용해요. 먼저 노코드로 탐색하고 실험한 뒤, CI/CD에서 자동화된 회귀 테스트를 위해 코드 기반으로 전환하세요. 두 워크플로우의 결과는 같은 대시보드에 나타나요.
핵심 기능
데이터셋 관리 (Dataset Management)
LLM 애플리케이션을 체계적으로 벤치마킹할 수 있도록 테스트 케이스 데이터셋을 만들고 정리하고 버전을 관리해요.
실험 (Experimentation)
프롬프트, 모델, 파라미터를 상세한 분석과 인사이트와 함께 비교하는 실험을 실행해요.
A|B 회귀 테스트
AI 앱의 서로 다른 버전을 나란히 비교하며 테스트 케이스별로 회귀(regression)를 잡아내요.
CI/CD 단위 테스트
네이티브 pytest 평가를 배포 CI/CD 파이프라인에 통합해요.
기초 배우기
LLM 평가가 처음이라면, 다음 개념들이 평가를 최대한 활용하는 데 도움이 될 거예요:
- 싱글턴 vs 멀티턴 평가 — 각 접근 방식을 언제 써야 하는지 이해하기
- 테스트 케이스, 골든스, 데이터셋 — 평가의 기본 구성 요소
- LLM-as-a-Judge 메트릭 — 자동 스코어링이 어떻게 동작하는지