Constitutional AI 논문 — Harmlessness from AI Feedback
Constitutional AI 논문 — Harmlessness from AI Feedback
Constitutional AI를 처음 제안한 학술 논문(2022)이에요. 사람 대신 원칙 집합(헌법) 을 사용해 AI가 자기 출력을 평가·수정하도록 하는 2단계 훈련을 소개해요.
2단계 훈련
-
Supervised stage (SL-CAI)
- 모델이 유해한 응답을 생성하면 헌법의 원칙에 따라 자기 응답을 비판하고 재작성하게 해요.
- '어떤 응답이 덜 해로운가' 같은 원칙 질문으로 수정을 유도해요.
-
Reinforcement learning stage (RL-CAI)
- 원칙 기준으로 AI 피드백(좋아요/싫어요)을 만들어 RLHF 대신 정책을 최적화해요.
- 사람이 일일이 라벨을 붙일 필요를 크게 줄여요.
핵심 성과
- CAI는 도움(helpfulness)과 무해함(harmlessness)을 동시에 개선하는 파레토 개선을 보여줘요.
- 탈옥(red-teaming) 저항성과 투명성을 높이고, 정렬 비용을 낮춰요.
참고
- 논문의 원칙 세트는 연구용이며, 실제 Claude에 쓰이는 헌법과는 다를 수 있어요.