OWASP LLM01 — 프롬프트 주입과 완화 전략
OWASP LLM01 — 프롬프트 주입과 완화 전략
Prompt Injection 은 사용자 프롬프트가 LLM의 행동·출력을 의도치 않게 바꾸는 취약점이에요. Jailbreaking 은 그중 모델이 안전 규정을 완전히 무시하게 만드는 형태예요.
유형
- 직접(Direct) 주입: 사용자 입력이 모델 행동을 직접 변경(의도적/비의도적).
- 간접(Indirect) 주입: 웹·파일에 담긴 외부 콘텐츠에 숨겨진 지시가 모델을 조작.
완화 전략
- 모델 행동 제한: 시스템 프롬프트에서 역할·한계를 명시하고 핵심 지시 수정을 무시하도록.
- 출력 형식 정의·검증: 형식과 출처 인용을 요구하고 결정적 코드로 검증.
- 입출력 필터링: 민감 범주 규칙 + 의미론적 필터, RAG Triad(context relevance·groundedness·QA relevance)로 응답 평가.
- 최소 권한(least privilege): 모델에 최소 접근 권한만, 확장 기능은 코드에서 처리.
- 고위험 행동엔 인간 승인: human-in-the-loop.
- 외부 콘텐츠 분리·식별: 신뢰할 수 없는 콘텐츠를 명확히 구분.
- 적대적 테스트: 정기 펜테스트·공격 시뮬레이션.