Llama Prompt Guard 2 (프롬프트 인젝션 탐지)
Llama Prompt Guard 2 (프롬프트 인젝션 탐지)
프롬프트 인젝션 공격을 감지하는 경량 가드레일 모델이에요. Llama Prompt Guard 2는 Llama 4 라인(Llama 4 Maverick·Scout)을 지원하는 새 고성능 업데이트로, Llama 3 라인도 지원해서 기존 Prompt Guard를 모든 사용 사례에서 대체할 수 있어요. Llama Guard가 콘텐츠 안전 분류를 맡는다면, 이 모델은 프롬프트 공격 여부에만 집중해요.
모델 크기
Llama Prompt Guard 2는 86M과 22M 두 가지 크기로 나와서, 다양한 사용 사례에 유연하게 대응할 수 있어요. 86M 모델은 영어와 비영어 공격 모두에 대해 학습했어요. 개발자가 프롬프트 공격 위험을 줄이도록 오픈소스로 공개된 도구라서, 단순하면서도 커스터마이즈가 자유로워요. 상세한 기술 정보는 GitHub의 공식 모델 카드를 참고하면 돼요.
프롬프트 공격과 Llama Prompt Guard 2
Llama Prompt Guard 2는 BERT 계열 모델이고, 라벨만 출력해요. Llama Guard와 달리 특정 프롬프트 구조나 설정이 필요 없어요. 입력은 문자열 하나이고, 모델이 이 문자열을 benign(정상) 또는 malicious(악성)으로 라벨링해요.
직접·간접 프롬프트 인젝션을 가려내는 것이 핵심 역할이에요. 프롬프트가 악의적인 지시로 오염됐는지를 빠르게 판별하므로, LLM 애플리케이션의 입구에서 간단한 사전 필터로 쓰기 좋아요. 사용 예시는 llama-cookbook의 Prompt Guard 튜토리얼 노트북에서 볼 수 있어요.
Llama Guard와의 차이
Llama Guard는 카테고리 기반으로 콘텐츠 안전을 분류하는 반면, Llama Prompt Guard 2는 공격 여부(정상/악성)만 이진 라벨로 판정해요. 따라서 두 모델은 역할이 다르고, 시스템 수준 보호막(Llama Protections)을 구성할 때 함께 배치되는 경우가 많아요.