RLHF — 인간 피드백으로 모델을 정렬하는 강화학습
RLHF
사전학습만으로는 모델이 '도움이 되는' 말을 하지 않아요. **RLHF(Reinforcement Learning from Human Feedback)**는 인간의 선호를 보상으로 삼아 모델을 원하는 방향으로 끌어당기는 정렬(alignment) 방법이에요. 오픈소스에서는 Hugging Face의 TRL 라이브러리가 SFT·PPO·GRPO·DPO 등을 통합 제공해서, 이론에서 실제 훈련까지 이어줘요.
이 카테고리의 문서
- 개요: TRL — 모델 정렬 훈련의 전과정 라이브러리
- 핵심 기능: PPO Trainer — 전통적 RLHF의 축
- 실전·API: GRPO — 보상 모델 없이 그룹 상대 비교로 최적화