Human-in-the-Loop 소개
Human-in-the-Loop 소개
도메인 전문가가 AI 테스트에 기여하는 방법을 배워요.
출처: 문서
본문
개요
Confident AI는 최종 사용자와 내부 어노테이터가 모니터링되는 트레이스, 스팬, 스레드에 인간 어노테이션을 남길 수 있게 해요. Confident AI는 비기술 팀까지도 다음과 같은 일을 할 수 있는 중앙 집중 장소를 제공해요:
- 데이터셋 어노테이션하기
- 최종 사용자 피드백 추적
- 메트릭을 인간 판단과 정렬
- 다른 이해관계자가 내부적으로 검토할 어노테이션 남기기
LLM 시스템에 피드백을 주는 실제 인간이 없다면, 평가는 vibe-coding과 다를 바 없어요.
Human-in-the-loop는 LLM 평가 파이프라인에서 가장 중요한 워크플로 중 하나예요. LLM 평가가 인간 판단을 자동화하고 확장하지만, 대체하지는 않기 때문이에요.
두 가지 평점 시스템
Confident AI에서 두 평점 시스템을 섞어 쓸 수 있어요:
엄지 위/아래
0 또는 1, 그것뿐이에요.
5성 평점
1부터 5까지, 양끝을 포함해요.
두 평점 시스템을 Confident API나 UI로 구성하는 방법은 다음 섹션들에서 배울 거예요.
어노테이션을 남기는 두 가지 방법
Confident AI에 어노테이션을 남기는 두 가지 방법이 있어요:
최종 사용자 피드백
- Confident API를 통해 보내야 해요
- Python과 Typescript DeepEval 사용 가능
적합한 대상: 사용자에게 노출되는 커스텀 피드백 수집 UI를 가진 사람
내부 피드백
- UI에서만 남길 수 있어요
- 트레이스, 스팬, 스레드에서 사용 가능
- 자동 수집을 통해 프로덕션 필터로 선택적으로 공급
적합한 대상: 이해관계자에게 판단을 표면화해야 하는 내부 도메인 전문가, QA 팀, PM
Single vs Multi-Turn
Single-turn 어노테이션은 트레이스 또는 스팬에 남기는 어노테이션을 말하고, multi-turn은 스레드의 어노테이션을 말해요. single과 multi-turn 어노테이션의 유일한 차이는 single-turn이 선택적 expected output을, multi-turn이 선택적 expected outcome을 받는다는 것이에요.