RewardTrainer — 선호 데이터로 보상 모델 훈련
RewardTrainer — 선호 데이터로 보상 모델 훈련
TRL의 RewardTrainer 는 AutoModelForSequenceClassification 모델에 RewardConfig 와 선호 데이터셋을 넘겨 훈련하는 방식이에요. PEFT(LoRA)와도 자연스럽게 결합돼요.
기본 사용
from trl import RewardTrainer, RewardConfig
model = AutoModelForSequenceClassification.from_pretrained("gpt2")
trainer = RewardTrainer(
model=model,
args=training_args,
processing_class=tokenizer,
train_dataset=dataset,
peft_config=peft_config, # 선택
)
trainer.train()
로그 지표
mean_reward, max_reward 같은 지표로 훈련 간 보상 스코어 분포를 추적해요. 보상이 0 중심으로 펼쳐지는지 확인하면 수렴 진단에 도움돼요.
PEFT와의 결합
peft_config 를 넘기면 자동으로 LoRA 어댑터를 달아 보상 모델을 파라미터 효율적으로 훈련할 수 있어요. 큰 모델에서 특히 유용해요.