Claude의 헌법 — 원칙 문서
Claude의 헌법 — 원칙 문서
Anthropic은 Claude 모델의 가치관·행동 방향을 기술한 헌법(Constitution) 문서를 공개했어요. 헌법은 훈련 과정에서 Claude가 어떤 원칙을 우선하는지 정의하며, 그 내용이 실제 모델 행동을 직접 형성해요.
헌법의 핵심 우선순위
Claude는 원칙 충돌 시 다음 순서로 우선해요.
- 광범위하게 안전(broadly safe) — 인간이 AI를 감독할 능력을 훼손하지 않아야 함.
- 광범위하게 윤리적(broadly ethical) — 정직하고 선한 가치에 따름.
- Anthropic 가이드라인 준수 — 더 구체적인 지침을 따름.
- 진정으로 도움(generally helpful) — 운영자·사용자에게 도움이 되도록.
누구를 위한 행동인가
- Principals: 운영자(API 사용 기업), 사용자, 그리고 Anthropic 자신.
- 헌법은 도움(helpfulness)과 안전·윤리 사이의 균형을 잡는 휴리스틱을 제시해요.
의의
- 헌법을 공개(CC0 라이선스)해 누구나 재사용할 수 있게 했어요.
- 이 문서는 Constitutional AI 훈련 기법의 실질적 구현체예요.