RLHF — 인간 피드백으로 모델을 정렬하는 강화학습

RLHF

사전학습만으로는 모델이 '도움이 되는' 말을 하지 않아요. **RLHF(Reinforcement Learning from Human Feedback)**는 인간의 선호를 보상으로 삼아 모델을 원하는 방향으로 끌어당기는 정렬(alignment) 방법이에요. 오픈소스에서는 Hugging Face의 TRL 라이브러리가 SFT·PPO·GRPO·DPO 등을 통합 제공해서, 이론에서 실제 훈련까지 이어줘요.

이 카테고리의 문서

  • 개요: TRL — 모델 정렬 훈련의 전과정 라이브러리
  • 핵심 기능: PPO Trainer — 전통적 RLHF의 축
  • 실전·API: GRPO — 보상 모델 없이 그룹 상대 비교로 최적화

출처: https://huggingface.co/docs/trl/index