Reward Modeling — 모델이 '선호'를 점수로 배우다
Reward Modeling
강화학습으로 LLM을 정렬하기 전에, 무엇이 좋은 답인지 점수로 표현하는 모델이 필요해요. Reward Modeling(보상 모델링) 은 선호(preference) 데이터로 '더 좋은 응답에 더 높은 점수'를 주는 함수를 학습하는 post-training 단계예요. TRL의 RewardTrainer 가 대표 도구예요.
이 카테고리의 문서
- 개요: TRL Reward Modeling — 보상 모델과 브래들리-테리 손실
- 핵심 기능: TRL Trainer — RewardTrainer로 선호 데이터 훈련
- 실전·API: TRL 퀵스타트 — SFT·보상·GRPO 파이프라인