콘텐츠 모더레이션
콘텐츠 모더레이션
LLM 애플리케이션에 들어오거나 생성되는 콘텐츠를 검열하는 일은 GenAI 보안의 핵심 축이에요. Lakera AI Guardrails의 콘텐츠 모더레이션은 유해하거나 원하지 않는 콘텐츠를 감지해서 조직 정책을 위반하는 일을 막아줘요. 자기 혼자 쓰기보다는 프롬프트 방어와 함께 조합하는 게 효과적인데, 이렇게 방어를 겹겹이 쌓으면 모델이 조종당해서 규제 대상 콘텐츠를 뱉어내는 상황까지 차단할 수 있기 때문이에요.
임계값 수준
콘텐츠 모더레이션 감지기도 다른 AI Guardrails 감지기와 같은 L1~L4 임계값 수준을 사용해요. 임계값이 높을수록 감지는 더 엄격해져 위협이 빠져나갈 확률은 줄지만 오탐이 늘 수 있어요.
감지기(Detectors) 유형
범죄·불법 활동
사기, 테러, 범죄 계획, 사이버 범죄(피싱, 해킹, 불법 복제 등), 기밀 정보 추출, 불법 마약 활동, 아동 학대·착취, 인신매매, 위조, 스토킹, 협박, 폭력 범죄(살인 등)처럼 불법 활동을 논의하거나 언급하는 텍스트를 감지해요.
혐오 발언·괴롭힘
특정 집단이나 그 구성원을 겨냥한 괴롭힘 언어를 표현·선동·조장하는 콘텐츠를 의미해요. 보호 집단에 대한 폭력·피해, 멸칭(slur)을 통한 차별을 포함해요. 다만 비특정적 성차별적·반성차별적 내용, 단순히 무례하거나 불손한 내용, 차별적이지 않은 멸칭은 여기에 포함되지 않아요 (후자는 비속어 감지기로 잡힐 수 있어요). 예를 들어 "Chess players are all nerds." 같은 문장은 취미·스포츠 관련 집단에 대한 표현이라 혐오 발언으로 보지 않아요. 또 개인이나 보호 집단·속성을 언급하지 않는 독성 콘텐츠는 독성일 수는 있어도 혐오 발언은 아니에요.
비속어 (Profanity)
욕설, 강한 언어, 저속한 표현, 악담을 포함하는 텍스트를 감지해요. 강조용으로 쓰인 노골적인 표현도 포함돼요. leet script나 일부러 낸 오타 같은 난독화 기법으로 위장한 비속어도 감지해서, 금칙어 정확 매칭을 우회하려는 시도를 차단해요. 비저속적 모욕이나 불쾌하지 않은 성적 용어는 이 범주에 속하지 않아요.
성적 콘텐츠
성 기관, 성행위, 성적 행동, 성적 취향을 묘사하거나 조장하는 자료를 감지해요. 에로틱·노골적 성 콘텐츠부터 교육·웰니스 성 자료까지 포함하며, 성매매·매춘·호위 서비스 같은 상업적 성 활동을 권유·광고하는 내용도 감지해요. 성적이지 않은 비속어나 여성 혐오는 이 감지기의 범위가 아니에요.
폭력 묘사
사람이나 동물의 사망·부상을 언급하는 모든 텍스트를 포함해요. 폭력적 위협, 잔혹한 전쟁 보도, 자해·자살, 신체적 피해·살인에 대한 진술, 사고 묘사, 책·영화·게임 속 잔혹 장면까지 폭넓게 감지해요.
자해 (Self harm)
자해, 자살, 기타 위험한 활동이나 개인을 위험에 빠뜨릴 수 있는 자기 파괴적 행동을 언급·조장·상세히 기술하는 텍스트를 감지해요.
커스텀 모더레이션
내장 감지기 외에 다른 콘텐츠 유형이나 특정 트리거 단어·문구를 감지하는 커스텀 콘텐츠 모더레이션 가드레일도 만들 수 있어요.
더 알아보기
- AI Guardrails를 평가할 때 쓸 수 있는 데이터셋: Datasets
- 실제 환경에서 원하지 않는 콘텐츠를 탐지하는 방법: Detecting undesired content in the real world
- 관련 문서: 프롬프트 인젝션 방어