Azure Prompt Shields — 공격 입력을 생성 전에 차단

Azure Prompt Shields — 공격 입력을 생성 전에 차단

Prompt Shields 는 Azure AI Content Safety의 통합 API로, LLM에 대한 적대적 사용자 입력 공격을 탐지·차단해요. 콘텐츠가 생성되기 전에 프롬프트와 문서를 분석해 유해·비안전·정책 위반 출력을 막아요.

사용자 프롬프트 공격 탐지

사용자 프롬프트 공격(기존 명칭 Jailbreak risk detection)은 시스템 제한을 우회하려는 공격 유형을 잡아요.

  • 시스템 규칙 변경 시도: 규칙·제한 없는 새 무제한 어시스턴트를 요구하거나, 규칙을 무시하라는 요청
  • 대화 모의 삽입: 한 쿼리에 조작된 대화 턴을 심어 제한을 무시하게 유도
  • 역할극(Role-Play): 제한 없는 '다른 시스템 페르소나' 역할 부여
  • 인코딩 공격: 암호·문자 변형 등으로 규칙 우회

문서 공격 탐지

사용자·개발자가 직접 넣지 않은 외부 문서(웹·파일)에 숨겨진 지시를 감지해 세션 통제 탈취를 막아요. Azure 기반 생성형 AI 앱에서 활용돼요.

더 알아보기