Prompt Injection — 신뢰할 수 없는 지시의 공격
Prompt Injection
LLM은 시스템 프롬프트와 사용자 메시지를 같은 컨텍스트 안의 토큰으로 봐요. 그래서 문서·이메일·도구 결과 같은 신뢰할 수 없는 콘텐츠에 숨은 지시가 내 지시를 덮어쓸 수 있어요. 이것이 Prompt Injection(프롬프트 인젝션) 입니다. 입력 스크리닝, 견고한 시스템 프롬프트, 신뢰 채널 분리로 방어해요.
이 카테고리의 문서
- 개요: 제일브레이크·프롬프트 인젝션 완화 — 방어 원칙
- 핵심 기능: 안전한 에이전트 배포 — 위협 모델과 심층 방어
- 실전·API: 프롬프트 엔지니어링 — 신뢰 채널 설계
출처: https://docs.anthropic.com/en/docs/test-and-evaluate/strengthen-guardrails/mitigate-jailbreaks