오류 분석
오류 분석 (Error Analysis)
여러분의 어노테이션에서 실패 패턴을 발견하고, 같은 문제를 자동으로 잡아내는 메트릭으로 바꿔요.
출처: 문서
본문
개요
Error Analysis는 팀이 어노테이션 큐 항목에 남기는 질적 피드백 — 설명, 예상 출력, 예상 결과 — 을 구조화된 실패 모드(failure modes) 로 바꾸고, 각각에 대한 구체적인 메트릭을 제안해요. 무엇이 잘못되고 있는지 알려면 수백 개의 어노테이션을 읽는 대신, 이름 붙은 패턴의 짧은 목록("Hallucinated tool arguments", "Misinterpreted user intent" 등)과, 각각에 대한 Create Metric / Use Existing Metric / Update Metric 추천을 받아 한 번의 클릭으로 행동할 수 있어요.

큐의 Error Analysis 이력
어노테이션 큐의 왼쪽 레일에서 Error Analysis를 여세요. 페이지는 그 큐에 대한 모든 분석 실행을, 가장 최근 것에 Latest 배지와 함께, 그리고 총 실행 수, 발견된 실패 모드 수, 생성된 고유 메트릭 수 통계를 나열해요.
Error Analysis는 프로젝트의 구성된 생성 모델로 실행되는 LLM 구동 파이프라인이에요. 어떤 모델이 쓰이는지, 바꾸는 방법은 Evaluation Models을 보세요.
자격
실행은 의미 있는 패턴을 만들려면 평가자 피드백(즉 Explanation 또는 Expected output / Expected outcome)이 있는 완료 어노테이션 10개 이상이 필요해요. 10개가 될 때까지 페이지는 가드를 보여줘요:
More annotations needed — You have N completed annotations with evaluator feedback. At least 10 are required to run a meaningful error analysis.
설명 없는 단순 엄지/별점은 세지 않아요 — 분석에는 이유가 필요하니까요.
실행이 어떻게 동작하나요
Run Analysis를 클릭해 파이프라인을 시작해요. 백그라운드로 돌며 세 단계를 거쳐요:
분류하기
모델이 자격이 되는 모든 어노테이션을 읽고 최상위 실패 모드로 그룹화해요 — 무엇이 잘못됐는지의 반복 패턴이죠.
하위 모드 생성하기
각 실패 모드는 하위 모드로 확장돼요: 더 구체적인 발현이고, 각각 HIGH, MODERATE, 또는 LOW 확실도(certainty)로 태그되어 어떤 패턴이 잘 뒷받침되고 어떤 것이 추측인지 알 수 있어요.
메트릭 제안하기
모든 실패 모드에 대해 모델은 세 가지 조치 중 하나를 제안해요:
- Create new metric — 이 패턴을 탐지하도록 조정된 완전히 새로운 메트릭(이름, 크라이테리아, 평가 단계).
- Use existing metric — 프로젝트의 메트릭 하나가 이미 이 패턴을 커버해요.
- Update existing metric — 기존 메트릭이 가깝지만, 크라이테리아나 단계를 조정해야 해요.
각 제안은 데이터가 얼마나 강하게 뒷받침하는지 반영한 priority(HIGH / MEDIUM / LOW)를 받아요.
파이프라인이 끝나면 아래의 실행 상세 페이지로 자동 라우팅돼요.
실행 읽기

실행 안의 실패 모드와 메트릭 제안
실행 상세 페이지는 분석이 식별한 모든 실패 모드를 나열해요. 각 카드에는:
- 실패 모드 이름과 설명, 그리고 priority 배지.
- 선택적 하위 모드 — 더 구체적인 패턴의 접을 수 있는 목록, 각각 자체 설명과 확실도 알약이 있어요.
- 권장 조치, 모델의 근거, 제안된 메트릭 세부 정보(이름, 크라이테리아, 평가 단계 — Create용; 기존 메트릭 이름 — Use Existing용; "Proposed changes" diff — Update용)가 있는 메트릭 제안 카드.
- 그 제안 타입에 맞는 올바른 일을 하는 액션 버튼:
| Suggestion type | Action button | What happens |
|---|---|---|
| Create | Create Metric | Opens the metric editor pre-filled with the suggested criteria. Save to link the metric to this mode. |
| Use Existing | Use This Metric | Links the failure mode to the recommended existing metric. View Metric opens it for inspection. |
| Update | Review & Update | Opens the existing metric in the editor with the proposed changes pre-applied for review. |
실패 모드가 메트릭에 연결되면 카드는 Metric created / Metric linked / Metric updated로 바뀌고, 액션이 View Metric이 돼요 — 분석을 다시 실행하지 않고 메트릭을 다시 열 수 있어요.
실행 통계
실행 상단의 세 통계가 무엇이 만들어졌는지 요약해요:
- Failure Modes — 발견된 총 패턴 수와, 그중 메트릭 제안이 딸린 수.
- Metrics Linked — 이 실행에서 실패 모드에 연결된 고유 메트릭.
- High Priority — 모델이 높은 우선순위로 표시한 패턴.
제안 이력
분석을 여러 번 실행했다면, 각 실패 모드는 제안 이력을 유지해요 — 오래된 실행이 같은 패턴의 이전 추천을 Suggestion N of M 페이저 뒤에 보여줘요. 오래된 항목은 읽기 전용이고 Past suggestion으로 표시되어, 낡은 조언에 실수로 행동하지 않게 해요.
다시 실행하기
팀이 의미 있는 새 어노테이션을 추가했을 때마다 Run Analysis를 다시 클릭해요. 각 실행은 독립적이에요 — 오래된 실행은 이력 목록에 남아요 — 하지만 실패 모드와 연결된 메트릭은 이어지므로, 메트릭 스위트가 인간이 지적한 문제를 얼마나 잘 커버하는지 그림이 쌓여요.
Error Analysis는 빡빡한 루프로 작동할 때 가장 잘 돼요: 큐에서 배치를 어노테이션하고, 분석을 실행하고, 메트릭 제안을 수락하고, 라이브 트레이스에서 그 메트릭을 실행하고, Eval Alignment에서 표면화된 정렬 불일치 케이스로 큐를 다시 찾아보세요.
Annotation Queues
큐를 구성하고, 검토자를 배정하고, 자동 수집으로 채워요.
Eval Alignment
메트릭의 판정을 인간 어노테이션과 비교해요.