출력 품질 평가하기

출력 품질 평가하기 (Evaluating output quality)

AI 출력이 무엇을 "좋은" 것으로 만드는지 정의하고 그 기준에 대해 테스트하는 것은 핵심 디자인 작업이에요. UI 패턴이 누군가의 필요에 부응하는지 평가하듯, AI 출력을 평가한다는 것은 모델의 응답이 맥락에서 유용하고, 신뢰할 수 있으며, 적절한지 묻는 것을 의미해요. 이 페이지에서는 이벌(elval)이 무엇인지, 왜 UX에 중요한지, 핵심 구성 요소와 인간 중심 이벌의 일곱 가지 핵심 결정 지점을 살펴볼게요.

출처: 문서

본문

AI 출력이 무엇을 "좋은" 것으로 만드는지 정의하고 그 기준에 대해 테스트하는 것은 핵심 디자인 작업이에요. UI 패턴이 누군가의 필요에 부응하는지 평가하듯, AI 출력을 평가한다는 것은 모델의 응답이 유용하고, 신뢰할 수 있으며, 맥락에서 적절한지 묻는 것을 의미해요. 그 판단에는 UX 전문성이 필요해요. 그것 없이는 AI 시스템이 사람들에게 가장 가치 있는 것이 아니라 측정하기 가장 쉬운 것을 위해 최적화돼요.

이벌이란 무엇인가요

가장 단순하게, 이벌은 테스트예요. AI 시스템에 입력을 주고, 특정 직무와 시나리오에 대해 출력이 기대를 충족하는지 판단하기 위해 정의된 기준을 적용해요.

이벌은 흔히 다음에 사용돼요:

  • 주어진 맥락에서 "좋은" AI 출력이 무엇을 의미하는지 명확히 하기
  • 접근 방식이나 반복을 비교하기
  • 시스템이 진화함에 따라 품질의 변화를 감지하기

이벌을 직접 실행하지 않을 수도 있어요. 많은 UX 실무자는 시나리오, 품질 기준, 예시, 또는 실패 패턴을 정의하는 데 기여하며, 나중에 다른 사람들이 그것을 공식화하거나 자동화해요.

이벌이 UX에 왜 중요한가요

AI 출력은 기술적으로 정확해도 여전히 좋지 않은 사용자 경험일 수 있어요. 혼란스럽거나, 신뢰가 낮거나, 의도와 어긋나거나, 행동에 옮기기 위험할 수 있죠.

UX 입력은 이벌에서 종종 가치 있는데, UX가 다음이 맞는지에 집중하기 때문이에요.

  • 실제 맥락에서 유용한지
  • 추가 해석 없이 이해 가능한지
  • 행동에 옮겨도 될 만큼 신뢰할 수 있는지

인간 중심 렌즈가 없으면 시스템은 사람들에게 가장 중요한 것이 아니라 측정하기 가장 쉬운 것을 최적화하는 경향이 있어요. 이벌은 인간의 판단을 더 명시적이고 더 반복 가능하게 만들어요.

이벌의 핵심 구성 요소

대부분의 이벌은 같은 핵심 구성 요소의 어떤 버전을 포함해요.

프롬프트 세트 (Prompt set): 사용자 목표나 의도를 나타내는 프롬프트의 모음으로, 사람들이 실제로 그 목표를 어떻게 설명하는지 반영하는 자연어로 쓰인 것.

맥락 또는 데이터 세트 (Context or data set): 시스템이 참조할 수 있는 근거 자료로, 파일, 이메일, 채팅, 기록 등.

루브릭 (Rubric): 출력 품질이나 동작을 판단하는 데 사용되는 기준.

골든 세트 (Golden set): 입력과 예상 정답("ground truth")이 검토되어 합의된 작은 예시 모음. 출력의 일관성을 비교하는 데 사용됨.

이 요소들은 맥락에 따라 단순하거나 더 구조화될 수 있어요. 또는 한두 개 요소로 시작해 시간이 지나며 나머지를 추가할 수도 있어요.

인간 중심 이벌의 핵심 결정

사용자 의도에서 측정 가능한 품질로 가기 위해 다음 일곱 가지 결정 지점을 고려하세요.

1. 청중과 시나리오 정의하기

이벌 과정은 종종 출력이 누구를 위한 것이고 사용자가 무엇을 성취하려 하는지 명확히 하는 것에서 시작해요. 이것은 이벌을 실제 고객 시나리오에 근거하도록 유지하는 데 도움이 돼요.

다음 질문을 고려하세요:

  • 시스템은 누구를 위해 일하나요?
  • 출력이 제공하는 목적은 무엇인가요?
  • 사용자가 AI 시스템에 어떤 작업을 요구하나요?
  • 고객의 관점에서 성공은 어떤 모습인가요?

예시

AI 시스템: 회의 준비 에이전트(Meeting Prep Agent) 사용자: Contoso의 정보 근로자. 에이전트 설명: 맥락, 이해관계자, 기대, 자료, 원하는 결과를 빠르게 명확히 해 사용자가 다가오는 회의를 준비하도록 돕는 어시스턴트. 시나리오: "Help me understand the upcoming meeting and those who will attend." 결과: 사용자가 다음을 할 수 있음.

  • 회의가 무엇에 관한 것인지 빨리 이해
  • 누가 참석하고 그들이 무엇을 신경 쓰는지 이해
  • 이 회의가 그들의 더 넓은 목표와 어떻게 연결되는지 이해

2. 데이터 경계 정의하기

AI 시스템이 접근하고 의존하도록 허용된 정보와 무시해야 할 정보를 명확히 하세요. 이러한 결정은 일반적으로 인간에 의해 정의되며(예: 검색 설정, 시스템 설계, MCP 구성), 자신 있지만 뒷받침되지 않는 출력을 줄이는 데 도움이 돼요.

고려 사항은 다음과 같아요.

  • 어떤 출처가 범위 안인지
  • 어떤 출처가 범위 밖인지
  • "최신"이 의미하는 것(시간 창)
  • 출처가 충돌할 때 어떤 출처가 권위적인지

예시

회의 준비 에이전트는 최근 30일간의 회의 노트, 현재 캘린더 초대, 최근 메시지, 참석자 목록을 사용할 수 있어요. 관련 없는 프로젝트 문서와 사용자가 접근할 수 없는 콘텐츠는 무시해야 해요.

3. 프롬프트 세트 구성하기

프롬프트 세트는 내부 기능 용어가 아니라 실제 사용자 언어를 사용해 사람들이 실제로 어떻게 도움을 요청하는지 반영해요. 명확화 질문을 테스트하기 위한 모호함도 포함하세요.

프롬프트 세트는 다음을 포함할 수 있어요.

일반적이고 직관적인 프롬프트:

"Summarize where we are for tomorrow's meeting."

"What decisions do we need to make?"

맥락이 누락된 짧은 프롬프트:

"Fastest prep."

모호하거나 경계 사례 요청:

"Summarize where we are. Only include confirmed decisions and cite where each decision came from."

4. "좋은" 동작 정의하기

이 시나리오에서 "좋은" 출력이 어떤 모습인지, 그 예시에 어떤 정보가 있고 어떻게 제시되어야 하는지 설명하는 예시와 기준을 사용해 정의하세요. 그다음 배운 점을 모델 동작, 프롬프트 설계, 종단 간 UX에 대한 결정을 안내하는 데 사용하세요.

예시

회의 준비 에이전트의 "좋은" 출력 기준은 다음일 수 있어요.

  • 출처 링크가 있는 정확한 요약
  • 노트에 뒷받침될 때만 나열되는 명확한 의제와 결정
  • 소유자가 이름이 명시될 때만의 행동 항목, 그리고 무언가 알려지지 않았을 때의 명확한 표시(추측 금지)

맥락이 없을 때 확실성을 암시해서는 안 돼요. 필수 정보를 이용할 수 없다면 응답이 추측을 사실로 제시해서는 안 돼요.

5. 품질 기준을 어서션으로 바꾸기

"좋음"을 출력 간에 일관되게 확인할 수 있는 명확하고 테스트 가능한 진술로 번역하세요. 일부 어서션은 자동화(LLM) 평가를 위해 설계되고, 다른 일부는 인간 판단을 요구해요. 대부분의 이벌은 둘 다 사용하므로, 어떤 유형을 쓰고 있는지 그리고 그것들이 어떻게 함께 작동하는지 명확히 하는 것이 중요해요.

예시

회의 준비 에이전트 어서션:

  • 시간 상자가 있는 의제 (0/1)
  • 각각 제공된 맥락에 근거한 상위 3가지 위험 (0-2)
  • 발명된 사실 없음 (필수 통과)

6. 이벌 테스트하기

프롬프트 세트를 실행하고 자동화된 검사와 인간 검토의 혼합을 사용해 각 출력을 어서션에 대해 채점하세요. 자동화된 검사는 구체적이고 관찰 가능한 요구사항을 검증하고, 인간 검토는 출력이 실제로 유용하고 행동할 준비가 되었는지 결정해요. 점수와 실패 이유를 기록하세요.

예시

프롬프트 세트의 각 프롬프트에 대해 모든 "결정" 불릿이 실제 노트나 이메일로 연결되는지 확인하는 자동화된 검사를 실행하세요. 그다음 인간 검토자가 답하게 하세요: "회의 10분 전이라면 이 준비가 실제로 나에게 도움이 될까요?"

7. 시간이 지나며 새로고침하기

이벌은 "설정하고 잊어버리는" 것이 아니에요. 제품이 변하고 사람들이 새로운 방식으로 사용하기 시작하면 이벌이 낡을 수 있어요. 그것들이 진화하지 않으면 실제 사용을 반영하지 않게 되고 품질이 잡히지 않은 채 표류할 수 있어요.

시간이 지나며 다음을 다시 확인하세요.

  • 프롬프트: 실제 사용에서 보이는 종류의 요청을 추가
  • 예시: 선호 형식이나 워크플로가 바뀌면 업데이트
  • 기준: 기대나 위험이 바뀌면 조정 (예: 고위험 시나리오에 대한 더 엄격한 규칙)

예시 (회의 준비):

몇 주 후 사람들이 "What do I need to do before this meeting?"이라고 자주 묻는 것을 알아차리면 그 프롬프트를 세트에 추가하고, 짧은 "Your prep" 섹션을 포함하도록 "좋은" 예시를 업데이트하며, 행동 항목이 노트에 명시적으로 명시될 때만 나열되도록 확인하는 자동화된 검사를 추가하세요.

평가 페이지

더 알아보기 (Learn more)