Claude의 헌법 — 원칙 문서

Claude의 헌법 — 원칙 문서

Anthropic은 Claude 모델의 가치관·행동 방향을 기술한 헌법(Constitution) 문서를 공개했어요. 헌법은 훈련 과정에서 Claude가 어떤 원칙을 우선하는지 정의하며, 그 내용이 실제 모델 행동을 직접 형성해요.

헌법의 핵심 우선순위

Claude는 원칙 충돌 시 다음 순서로 우선해요.

  1. 광범위하게 안전(broadly safe) — 인간이 AI를 감독할 능력을 훼손하지 않아야 함.
  2. 광범위하게 윤리적(broadly ethical) — 정직하고 선한 가치에 따름.
  3. Anthropic 가이드라인 준수 — 더 구체적인 지침을 따름.
  4. 진정으로 도움(generally helpful) — 운영자·사용자에게 도움이 되도록.

누구를 위한 행동인가

  • Principals: 운영자(API 사용 기업), 사용자, 그리고 Anthropic 자신.
  • 헌법은 도움(helpfulness)과 안전·윤리 사이의 균형을 잡는 휴리스틱을 제시해요.

의의

  • 헌법을 공개(CC0 라이선스)해 누구나 재사용할 수 있게 했어요.
  • 이 문서는 Constitutional AI 훈련 기법의 실질적 구현체예요.

더 알아보기