Llama 시스템 보호막 (시스템 수준 가드레일)

Llama 시스템 보호막 (시스템 수준 가드레일)

모델 하나만 잘 정렬해서는 생성형 AI 시스템의 안전을 보장하기 어려워요. Meta는 시스템 전반에 가드레일을 배치하도록 오픈소스 보호 솔루션을 제공해요. 이 페이지는 콘텐츠 정책을 정의하고, 모델 수준 정렬을 하고, 시스템 수준에서 안전 보호장치를 두는 책임 있는 GenAI 워크플로우의 자원을 정리해 줘요.

출처: Developer use guide resources | How-to guides

사용 사례 결정

제품의 의도된 용도와 사용자에 맞춰서, 어떤 콘텐츠를 허용할지 정의하는 콘텐츠 정책을 먼저 세워요. 불법·폭력·유해 콘텐츠 생성에 대한 안전 제한도 여기서 정해요. 이 한계는 제품 도메인과 지역별 법규를 고려해 평가해야 해요. 기관에서 발행한 원칙도 기준이 될 수 있어요 — OECD AI 원칙, NIST 신뢰할 수 있는·책임 있는 AI 리소스 센터, EU AI Act가 대표적이에요.

공통 합의된 피해를 바탕으로 기본 정책을 만들 때는 MLCommons가 정의한 피해 분류 체계(harm taxonomy)를 쓰면 돼요. 이 체계는 다음 13개 피해 영역으로 이뤄져요.

  1. 폭력 범죄 (Violent crimes)
  2. 비폭력 범죄 (Non-violent crimes)
  3. 성 관련 범죄 (Sex-related crimes)
  4. 아동 성 착취 (Child sexual exploitation)
  5. 무차별 무기: 화학·생물·방사선·핵·고위력 폭발물 (CBRNE)
  6. 자살·자해 (Suicide & self-harm)
  7. 혐오 (Hate)
  8. 전문적 조언 (Specialized Advice)
  9. 프라이버시 (Privacy)
  10. 지식재산권 (Intellectual Property)
  11. 선거 (Elections)
  12. 명예훼손 (Defamation)
  13. 성적 콘텐츠 (Sexual Content)

모델 수준 정렬

책임 있게 파인튜닝하려면 크게 세 단계를 거쳐요.

  1. 데이터 준비: 주석(annotation) 데이터셋을 만들 때는 프롬프트 작성·응답 작성·응답 라벨링에 대한 지침문을 명확히 제공해야 해요. 입력·출력의 정확한 모달리티, 어느 정책 카테고리로 주석을 달지, 필요한 언어를 지정하는 게 중요해요. 프라이버시 팀과 협의해 데이터 처리 방식과 추가 완화(이미지 블러 등)를 결정하고, 품질 기대치를 미리 명시해 두는 게 좋아요.
  2. 모델 학습: 안전을 위한 파인튜닝 기법은 Llama 2·Llama 3.1 연구 논문에서 자세히 다뤄요. Meta Llama 파인튜닝 레시피나 Hugging Face의 Alignment Handbook으로 시작할 수 있어요.
  3. 평가와 성능 개선: 안전 평가는 표준화돼야 투명하고 일관돼요. 공개 벤치마크 플랫폼(HELM, EleutherAI Evaluation Harness, Hugging Face Hub 등)과 Cybersec eval을 활용하는 걸 권장해요.

시스템 수준 정렬

책임 있는 배포를 위해 시스템 수준 보호장치를 배치해야 해요. Meta가 제공하는 오픈소스 솔루션은 크게 셋이에요.

  • Llama Guard 3: 다국어 콘텐츠 조정(moderation) 보호 모델
  • Prompt Guard: 직접·간접 프롬프트 인젝션 탐지 보호 모델
  • Code Shield: 안전하지 않은 코드 탐지 보호 모델

이 보호장치들로 시작하려면 GitHub의 레디투유즈 레시피와 PurpleLlama 저장소를 참고하면 돼요. Llama Guard를 우리 데이터셋으로 튜닝하는 노트북도 제공돼요.

투명성

안전을 위해 투명성과 피드백 경로가 매우 중요해요. Llama 모델 카드를 숙지하고, 나만의 모델 카드를 만들어 두는 걸 권장해요. Llama 모델이 생성한 유해 콘텐츠를 발견하면 피드백 경로로 알려줄 수 있어요.

더 알아보기 (Learn more)