가드레일 카탈로그 — 사전 구축 가드레일로 방어를 쌓는 방법
가드레일 카탈로그 — 사전 구축 가드레일로 방어를 쌓는 방법
가드레일을 처음부터 다 만들 필요는 없어요. NeMo Guardrails는 콘텐츠 안전, 젤브레이크 보호, 토픽 컨트롤, PII 탐지 같은 사전 구축 가드레일을 카탈로그로 제공해요. 각 가드레일은 설정 가능한 레일 흐름으로 구현돼서, config.yml의 input, output, retrieval 섹션에 넣기만 하면 돼요. NVIDIA가 학습한 안전 모델, 오픈소스 커뮤니티 모델, LLM 자체 점검 프롬프트, 타사 관리형 API 중 골라서 쓰고, 여러 접근을 묶어 심층 방어(defense in depth)를 구축할 수도 있어요.
카탈로그가 담고 있는 가드레일
콘텐츠 안전 (Content Safety)
입력·출력에서 유해 콘텐츠를 걸러내는 가드레일이에요. 콘텐츠 안전을 다루는 여러 모델과 서비스를 조합해 사용할 수 있어요.
젤브레이크 보호 (Jailbreak Protection)
안전 조치를 우회하려는 적대적 프롬프트를 탐지하는 가드레일이에요. 입력 레일로 동작하며, 악의적인 시도를 LLM에 도달하기 전에 차단해요.
토픽 컨트롤 (Topic Control)
대화가 정해진 주제 경계 안에 머물도록 하는 가드레일이에요. 주제를 벗어난 대화로 빠지지 않게 방향을 잡아주죠.
PII 탐지 (PII Detection)
개인식별정보를 탐지·마스킹해서 사용자 프라이버시를 지키는 가드레일이에요. 민감 데이터를 처리 전에 숨기거나 차단해요.
에이전트 보안 (Agentic Security)
도구를 쓰고 외부 시스템과 상호작용하는 LLM 에이전트를 보호하는 가드레일이에요.
도구 호출 (Tool Calling)
IORails 기반으로 모델이 낸 도구 호출과 애플리케이션이 돌려준 도구 결과를 검증하는 가드레일이에요.
환각·사실 확인 (Hallucinations & Fact-Checking)
LLM 출력이 증거에 근거하도록 사실 확인·환각 탐지를 하는 가드레일이에요.
LLM 자체 점검 (LLM Self-Check)
LLM 스스로 입력 점검, 출력 점검, 사실 확인을 수행하도록 프롬프트하는 가드레일이에요.
카탈로그 활용 팁
카탈로그의 각 항목은 독립적인 레퍼런스 페이지로 정리되어 있어요. 원하는 안전 정책에 맞는 항목을 골라 config.yml에 등록하고, 필요하면 여러 항목을 조합하면 돼요. 같은 위협에 대해 모델 기반 탐지와 휴리스틱 탐지를 함께 쓰는 식으로 다층 방어를 구성하면 특히 유용해요.
더 알아보기
- Guardrail Types — 다섯 가지 레일 타입과 각 단계별 역할.
- Content Safety — 콘텐츠 안전 가드레일 상세.
- Jailbreak Protection — 젤브레이크 탐지 가드레일 상세.