AI 해로의 유형

AI 해로의 유형 (Types of AI harm)

AI 시스템이 만들어 낼 수 있는 다양한 해로(피해) 유형을 분류하고, 각 유형을 어떻게 완화할 수 있는지 정리한 문서예요. 제품 팀이 올바른 RAI 원칙을 적용하고 피드백 메커니즘을 설계하는 데 도움이 된답니다.

출처: 문서

본문

AI 시스템은 사용자, 조직, 사회에 해를 끼치는 출력을 만들거나 행동을 보일 수 있어요. 해로는 의도하지 않을 수 있어요—모델의 한계, 부족한 UI 완화, 불명확한 커뮤니케이션으로 인해 발생할 수 있지만—그래도 사용자 신뢰를 훼손하고 실제 세계에 영향을 미칠 수 있어요.

해로 유형을 이해하면 제품 팀이 올바른 RAI 원칙을 적용하고, 관련된 피드백 메커니즘을 설계하며, 디자인 리뷰와 RAI 감사에서 완화 조치의 우선순위를 정할 수 있어요.

해로 유형 (Harm categories)

Inaccurate (부정확)

사실적으로 틀렸거나, 조작되었거나, 오해를 불러일으키는 출력.

Incomplete (불완전)

중요한 정보를 생략하거나, 작업을 끝내지 못하거나, 사용자의 요청을 따르지 못하는 출력.

Biased (편향)

정체성, 집단 소속, 문화적 맥락에 기반한 불공정한 가정을 반영하거나 증폭하는 출력.

Inappropriate or unsafe (부적절하거나 안전하지 않음)

사용자나 특정 집단에게 공격적이거나, 해롭거나, 잠재적으로 위험한 출력.

Non-transparent (비투명)

AI 참여, 데이터 출처, 시스템 한계, 사용자 선택의 의미를 공개하지 못하는 것.

Overreliance (과도한 의존)

종종 UX가 검증을 장려하지 못했기 때문에, 사용자가 비판적 검토 없이 AI 출력을 받아들이는 것.

부정확한 출력 (Inaccurate output)

부정확한 출력은 AI 시스템이 사실적으로 틀렸거나, 조작되었거나, 신뢰할 수 있는 출처에 근거하지 않은 콘텐츠를 생성할 때 발생해요. 여기에는 환각된 인용, 잘못된 통계, 오해를 부르는 요약, 또는 출처 자료와 모순되는 출력이 포함돼요.

부정확성은 가장 흔하고 결과가 큰 해로 유형 중 하나이며, 특히 건강, 법률, 금융 같은 고위험 영역에서 그래요. 검증 없이 부정확한 출력을 신뢰하는 사용자는 잘못된 정보에 기반해 결정을 내릴 수 있어요.

완화 조치로는 승인된 AI 고지("AI 생성 콘텐츠는 부정확할 수 있습니다. 정확성을 확인하세요.")를 항상 표시하고, 관련 출처를 제시하며, 사용자가 행동하기 전에 검증하도록 유도하는 UI 마찰 지점을 설계하는 것이 포함돼요.

불완전한 출력 (Incomplete output)

불완전한 출력은 AI 시스템이 중요한 정보를 생략하거나, 사용자의 요청을 채우지 못하고 그치거나, 기술적으로는 정확하지만 안전한 사용에 필요한 맥락이 빠진 응답을 제공할 때 발생해요.

불완전성은 사용자가 자신이 모르는 것을 모를 때 특히 해로워요—그들은 부분적인 응답을 완전한 것처럼 행동할 수 있어요. 이는 부정확성 해로를 더욱 악화시킬 수 있어요.

완화 조치로는 AI 작업을 명확하게 범위를 정하고, 점진적 공개(progressive disclosure)를 사용해 한계를 제시하며, 응답이 부분적이거나 시스템 능력에 제약되어 있다는 것을 전달하는 것이 포함돼요.

편향된 출력 (Biased output)

편향된 출력은 AI 시스템이 사람의 정체성, 인구통계 집단, 문화, 살아온 경험에 기반한 불공정한 가정을 반영하거나 증폭할 때 발생해요. 편향은 추천, 이미지 생성, 언어, 정보의 프레이밍에서 나타날 수 있어요.

AI 모델은 대규모 데이터셋에서 학습하기 때문에 사회적 편향을 대규모로 물려받아 재생산할 수 있어요. 편향 해로는 개별 출력에서 보이지 않고 사용자나 사용 사례를 가로지르는 패턴을 통해서만 드러나는 경우가 많아요.

완화 조치로는 포용적인 콘텐츠 검토, 사용자 그룹 전반의 다양한 테스트, 사용자가 검토를 위해 편향된 출력을 신고할 수 있는 피드백 메커니즘이 포함돼요.

부적절하거나 안전하지 않은 출력 (Inappropriate or unsafe output)

부적절하거나 안전하지 않은 출력에는 공격적이거나, 해롭거나, 차별적이거나, 실제 세계의 해를 촉진할 수 있는 콘텐츠가 포함돼요. 여기에는 개인이나 집단을 겨냥한 콘텐츠, 위험한 행동을 조장하는 콘텐츠, 커뮤니티 안전 기준을 위반하는 콘텐츠가 포함돼요.

이런 해로는 모델 수준의 가드레일과 UI 수준의 완화 조치가 모두 필요해요. 제품 팀은 사용자가 이런 유형의 콘텐츠를 신고할 명확한 경로를 갖고, 피드백이 모델 안전을 담당하는 팀에 도달하도록 해야 해요.

완화 조치로는 사용자가 "안전하지 않거나 문제가 있는 콘텐츠"를 신고할 수 있는 피드백 분류 컨트롤과, 제품 내 피드백에서 안전 검토 프로세스로 이어지는 명확한 에스컬레이션 경로가 포함돼요.

비투명한 출력 (Non-transparent output)

비투명성 해로는 사용자가 AI와 상호작용하고 있다는 것을 알지 못하거나, 출력에 어떤 출처가 반영되었는지 식별할 수 없거나, AI를 사용하거나 신뢰하는 것에 대한 정보에 입각한 결정을 내리는 데 필요한 정보를 제공받지 못할 때 발생해요.

여기에는 AI 라벨이나 배지 누락, 승인된 고지 부재, 모호한 데이터 출처, 데이터 사용에 대한 불명확하거나 누락된 동의 문구가 포함돼요. 비투명성은 기초적인 해로예요—이는 사용자가 다른 어떤 해로 유형도 평가하는 능력을 훼손해요.

완화 조치로는 AI 생성 콘텐츠를 항상 라벨링하고, 출처를 인라인으로 제시하며, 승인된 고지 텍스트를 사용하고, 진입점에서 AI 범위를 전달하는 것이 포함돼요. 상세한 UX 전략은 Responsible AI 가이드를 참조하세요.

과도한 의존 (Overreliance)

과도한 의존은 사용자가 적절한 비판적 사고나 검증을 적용하지 않고 AI 출력을 신뢰할 때 발생해요—종종 UI가 불확실성을 전달하거나, 검토를 유도하거나, 검증을 쉽게 만들지 못했기 때문이에요.

과도한 의존은 모델 수준의 해로만큼이나 디자인 수준의 해로예요. 경험이 자신감 있게 느껴지거나, 고지가 놓치기 쉬우거나, 행동 전에 검토를 장려하는 마찰이 없기 때문에 사용자가 AI에 과도하게 의존할 수 있어요.

완화 조치로는 정확성 경고를 인라인으로 제시하고, 명확한 출처 링크를 제공하며, AI 출력이 권위적으로 느껴지게 만드는 디자인 패턴을 피하고, 사용자가 콘텐츠를 적용하기 전에 검토하도록 유도하는 마찰 지점을 만드는 것이 포함돼요.

피드백과 해로 신고 (Feedback and harm reporting)

AI 출력에 대한 사용자 피드백을 수집하는 것은 대규모로 해로를 표면화하는 가장 직접적인 방법 중 하나예요. 피드백 메커니즘은 사용자가 신고하는 문제 유형을 분류할 수 있게 해야 해요. 의미 있는 피드백 범주는 다음과 같아요.

Do: 구체적인 해로 범주 사용

어떤 유형의 문제를 신고하시겠어요?

  • 출력이 사실이 아니었음
  • 불완전한 출력
  • 출처가 제공되지 않음
  • 안전하지 않거나 문제가 있는 콘텐츠
  • 의심스러운 출처
  • 기타

Don't: 모호한 프롬프트 사용

피드백을 주세요.

피드백은 어떤 데이터가 수집될지 명시적이어야 해요: "피드백을 제출하면 프롬프트와 응답이 포함됩니다." "개선을 도와주세요" 같은 모호한 언어는 사용자가 공유에 동의하는 것을 모호하게 만듭니다.

RAI 점수에서 Prevent overreliance on AI 원칙에 대해 0 또는 1 점수를 받으면 전체 점수와 관계없이 자동으로 실패 상태가 돼요. 이는 과도한 의존 방지가 책임 있는 AI 디자인에 얼마나 기초적인지를 반영해요.

리소스 (Resources)

RAI 원칙별 UX 전략, 평가 기준, 제품 내 do/don't 예시는 Responsible AI 가이드 페이지를 참조하세요.

추가 리소스:

  • RAI UX Quality Excellence Guidelines
  • Guidelines for Human-AI Interaction
  • Advancing AI trustworthiness: Updates on responsible AI research

더 알아보기 (Learn more)