Constitutional AI — 원칙으로 모델을 정렬하기

Constitutional AI (헌법적 AI)

모델이 따라야 할 일련의 원칙(헌법) 을 정해두고, 이 원칙에 맞춰 스스로 자기 출력을 비판·수정하게 훈련하는 정렬 방법을 Constitutional AI (CAI) 라고 해요. 사람의 피드백 의존도를 줄이면서 안전성과 유용성의 균형을 잡는 Anthropic의 기법이에요.

이 카테고리의 문서

  • 개요: Claude의 헌법 — 원칙 문서
  • 핵심 기능: Claude의 새 헌법 — 발표와 배경
  • 실전·API: Constitutional AI 논문 — Harmlessness from AI Feedback

출처: https://www.anthropic.com/constitution