Meta Llama Guard

Meta Llama Guard

Llama Guard는 Meta가 공개한 대형 언어 모델 기반의 입력·출력 가드레일 모델이에요. 생성형 AI 애플리케이션이 위험하거나 정책에 어긋나는 콘텐츠를 주고받지 않도록 프롬프트와 응답을 안전 분류(safety classification)로 검증하는 역할을 해요. 가드레일·안전 분류·입출력 검증에 관한 공식 문서를 모아 둔 카테고리예요.

이 카테고리의 문서

  • 가드레일 개요: Llama Guard가 어떤 원리로 안전을 지키는지
  • 안전 분류: 정책 카테고리와 분류 출력(safe/unsafe) 구조
  • 입출력 검증: 프롬프트·응답을 가드레일로 검증하는 방법
  • 모델별 차이: Llama Guard 1·2·3과 일반 LLM의 차이

출처: https://www.llama.com/docs/trust-and-safety/