LLM 평가 소개

LLM 평가 소개 (Introduction to LLM Evaluation)

Confident AI에서 LLM 평가는 배포 전(pre-deployment) 환경에서 데이터셋을 통한 벤치마킹을 뜻해요. 코드 없이 하는 방식과 코드로 하는 방식, 두 가지 중 팀에 맞는 워크플로우를 고를 수 있어요. 두 방식은 같은 평가 메트릭과 인사이트를 제공하니, 차이는 '어떻게 실행하느냐'에 있어요.

출처: 문서

본문

개요

Confident AI의 LLM 평가는 배포 전 환경에서 데이터셋을 통한 벤치마킹을 의미하며, 두 가지 방식으로 수행할 수 있어요:

  • 노코드(No-code) — 플랫폼 UI에서 직접 진행. QA, PM, SME(도메인 전문가)에게 가장 적합해요
  • 코드 기반(Code-driven) — deepeval 프레임워크 사용. 엔지니어와 QA에게 가장 적합해요

두 방식 모두 동일한 포괄적인 평가 메트릭과 인사이트에 접근할 수 있어요 — 차이는 실행 방식에만 있죠.

관측 데이터에 대한 **온라인 평가(프로덕션 모니터링용)**를 찾고 있다면 여기를 클릭하세요.

평가할 수 있는 것

코드 기반 방식과 노코드 방식 모두 다음 3가지 유스케이스를 평가할 수 있어요:

싱글턴 (Single-Turn)

Q&A, 요약, 분류 작업처럼 하나의 인풋 → 하나의 아웃풋 형태의 상호작용이에요.

멀티턴 (Multi-Turn)

여러 차례의 대화에서 컨텍스트가 쌓여가는 대화형 상호작용이에요.

에이전틱 워크플로우 (Agentic Workflows)

툴 콜(tool calls), 추론 체인(reasoning chains), 멀티스텝 실행을 포함하는 복잡한 시스템이에요.

워크플로우 선택하기

코드를 전혀 쓰지 않고 플랫폼 UI에서 평가를 실행하거나, deepeval을 프로그래밍 방식으로 사용할 수 있어요:

노코드 평가 (No-Code Evals)

  • 싱글 프롬프트·멀티 프롬프트 AI 앱에서 실험을 실행해요
  • Arena에서 프롬프트와 모델을 비교해요

적합한 대상: PM, QA 팀, 빠른 프로토타이핑

코드 기반 평가 (Code-Driven Evals)

  • CI/CD에서 자동화된 회귀 테스트(regression testing)를 수행해요
  • 아웃풋 생성을 완전히 제어해요
  • 버전 관리되는 평가 로직을 사용해요

적합한 대상: 엔지니어, 자동화 테스트

어느 쪽을 골라야 할지 모르겠다면?

대부분의 팀은 두 방식 모두 사용해요. 먼저 노코드로 탐색하고 실험한 뒤, CI/CD에서 자동화된 회귀 테스트를 위해 코드 기반으로 전환하세요. 두 워크플로우의 결과는 같은 대시보드에 나타나요.

핵심 기능

데이터셋 관리 (Dataset Management)

LLM 애플리케이션을 체계적으로 벤치마킹할 수 있도록 테스트 케이스 데이터셋을 만들고 정리하고 버전을 관리해요.

실험 (Experimentation)

프롬프트, 모델, 파라미터를 상세한 분석과 인사이트와 함께 비교하는 실험을 실행해요.

A|B 회귀 테스트

AI 앱의 서로 다른 버전을 나란히 비교하며 테스트 케이스별로 회귀(regression)를 잡아내요.

CI/CD 단위 테스트

네이티브 pytest 평가를 배포 CI/CD 파이프라인에 통합해요.

기초 배우기

LLM 평가가 처음이라면, 다음 개념들이 평가를 최대한 활용하는 데 도움이 될 거예요:

더 알아보기