OWASP LLM01 — 프롬프트 주입과 완화 전략

OWASP LLM01 — 프롬프트 주입과 완화 전략

Prompt Injection 은 사용자 프롬프트가 LLM의 행동·출력을 의도치 않게 바꾸는 취약점이에요. Jailbreaking 은 그중 모델이 안전 규정을 완전히 무시하게 만드는 형태예요.

유형

  • 직접(Direct) 주입: 사용자 입력이 모델 행동을 직접 변경(의도적/비의도적).
  • 간접(Indirect) 주입: 웹·파일에 담긴 외부 콘텐츠에 숨겨진 지시가 모델을 조작.

완화 전략

  1. 모델 행동 제한: 시스템 프롬프트에서 역할·한계를 명시하고 핵심 지시 수정을 무시하도록.
  2. 출력 형식 정의·검증: 형식과 출처 인용을 요구하고 결정적 코드로 검증.
  3. 입출력 필터링: 민감 범주 규칙 + 의미론적 필터, RAG Triad(context relevance·groundedness·QA relevance)로 응답 평가.
  4. 최소 권한(least privilege): 모델에 최소 접근 권한만, 확장 기능은 코드에서 처리.
  5. 고위험 행동엔 인간 승인: human-in-the-loop.
  6. 외부 콘텐츠 분리·식별: 신뢰할 수 없는 콘텐츠를 명확히 구분.
  7. 적대적 테스트: 정기 펜테스트·공격 시뮬레이션.

더 알아보기