AI Guardrails
AI Guardrails (가드레일 개요)
생성형 AI 애플리케이션을 운영하다 보면 위협이 어디서 어떻게 들어올지 예측하기 어려워요. Lakera AI Guardrails는 GenAI 애플리케이션에 실시간 가시성과 보안을 더해주는 플랫폼으로, Check Point가 관리하는 가드레일과 사용자가 직접 만드는 커스텀 가드레일을 함께 제공해요. 감지된 위협은 실시간으로 처리돼서 공격자를 차단하고, 최종 사용자와 애플리케이션, 그리고 이를 운영하는 조직을 보호해요.
GenAI가 마주하는 새로운 위협
LLM 기반 애플리케이션은 입력과 출력이라는 두 축 모두에서 위협에 노출돼요. 그래서 단순히 프롬프트 하나만 지키는 것으로는 부족하고, 입력과 출력 양쪽을 함께 검사하는 방어 설계가 필요해요. AI Guardrails는 이런 관점에서 여러 방어 카테고리를 한 플랫폼에 묶어 제공해요.
제공되는 방어 카테고리
- 프롬프트 방어(Prompt Defense): 직접·간접 프롬프트 공격을 감지하고 대응해요. 탈옥, 프롬프트 인젝션, LLM을 악의적이거나 의도치 않은 지시로 조종·착취하려는 시도를 포함해요.
- 콘텐츠 모더레이션(Content Moderation): 조직 정책을 위반하는 유해하거나 원하지 않는 콘텐츠를 감지·차단해요.
- 데이터 유출 방지(Data Leakage Prevention): 개인식별정보(PII) 보호, 시스템 프롬프트 유출 방지, 민감 데이터 유출 차단을 통해 데이터 보호·프라이버시 규정 준수를 돕고, 비용이 큰 유출 사고를 막아줘요.
- 악성 링크 탐지(Malicious links detection): 알 수 없는 링크를 감지해서 공격자가 LLM을 조종해 사용자에게 악성·피싱 링크를 보여주는 것을 차단해요.
- 에이전트 행동 방어(Agent Behavior Defense): Dangerous Deviation 감지기로 에이전트의 신뢰 범위를 벗어난 위험한 행동을 찾아내고, Tool Allow/Deny List로 런타임에 호출 가능한 도구를 통제해요.
시스템 프롬프트
보안의 첫 시작은 튼튼하고 안전하게 작성된 시스템 프롬프트예요. AI가 의도대로 안전하게 행동하도록 시스템 프롬프트를 만들고, 모든 LLM 입력(사용자 메시지는 물론 참조 콘텐츠)에 프롬프트 방어를 걸어두는 것이 기본이에요. 신뢰할 수 있는 출처라도 우연히 프롬프트 공격이 섞여 있을 수 있으니까요. 여기에 더해 콘텐츠 모더레이션, 데이터 유출 방지, 악성 링크 탐지 같은 가드레일을 실시간으로 붙이는 식으로 방어를 쌓아요.
관리형 가드레일과 커스텀 가드레일
Check Point가 관리하는 가드레일은 머신러닝과 언어 모델, 규칙 기반 필터를 조합해 검사 대상 내용 속 위협을 감지해요. 반면 커스텀 가드레일은 평문으로 '무엇을 감지할지'를 설명하면 내장 AI 어시스턴트가 이를 감지 정책으로 컴파일해줘요. 구조화된 형식에는 패턴 규칙을, 내용과 의도에는 의미 규칙을 적용하는 방식이에요. 커스텀 가드레일은 현재 베타로 제공돼요.
임계값(Threshold) 수준 — L1~L4
가드레일의 민감도는 정책(policies)에서 임계값 수준으로 조절해요. 이 값은 감지기가 위험을 판정하기 위해 도달해야 하는 신뢰도 수준을 정해요. AI Guardrails는 OWASP의 WAF 패러다노이드 레벨 정의에 맞춘 다음 네 단계를 사용해요.
- L1 — 관대함. 오탐(false positive)이 거의 없거나 전혀 없음.
- L2 — 균형. 오탐이 다소 있음.
- L3 — 더 엄격함. 오탐이 예상되지만 오탐률(false negative)은 매우 낮음.
- L4 — 극도의 민감함. 오탐이 많지만 오탐률이 거의 없거나 전혀 없음. 기본 임계값이에요.
임계값이 높을수록 가드레일이 더 엄격해져서 위협이 빠져나갈 확률은 줄지만, 정상적인 상호작용에서 오탐이 늘어날 수 있어요. 이 임계값은 감지기의 신뢰도를 조절하지, 위협의 심각도를 조절하는 것은 아니라는 점을 기억해두세요.
허용/거부 목록 (Allow and Deny Lists)
모델 결정을 일시적으로 덮어쓰는 커스텀 허용(allow)·거부(deny) 목록도 만들 수 있어요. 모델이 개선되는 동안 오탐이나 오탐률을 빠르게 해결하는 데 유용해요. 다만 이 기능으로 가드레일을 덮어쓰면 보안 허점이 생길 수 있으니, 임시 조치로만 쓰고 오분류된 프롬프트는 Check Point에 보고해 견고한 수정을 받는 것을 권장해요.
더 알아보기
- 관련 문서: 프롬프트 인젝션 방어, 콘텐츠 모더레이션, 데이터 유출 방지, Security Framework Coverage
- 시스템 프롬프트 작성 가이드: Crafting Secure System Prompts for LLM and GenAI Applications