RewardTrainer — 선호 데이터로 보상 모델 훈련

RewardTrainer — 선호 데이터로 보상 모델 훈련

TRL의 RewardTrainerAutoModelForSequenceClassification 모델에 RewardConfig 와 선호 데이터셋을 넘겨 훈련하는 방식이에요. PEFT(LoRA)와도 자연스럽게 결합돼요.

기본 사용

from trl import RewardTrainer, RewardConfig
model = AutoModelForSequenceClassification.from_pretrained("gpt2")
trainer = RewardTrainer(
    model=model,
    args=training_args,
    processing_class=tokenizer,
    train_dataset=dataset,
    peft_config=peft_config,   # 선택
)
trainer.train()

로그 지표

mean_reward, max_reward 같은 지표로 훈련 간 보상 스코어 분포를 추적해요. 보상이 0 중심으로 펼쳐지는지 확인하면 수렴 진단에 도움돼요.

PEFT와의 결합

peft_config 를 넘기면 자동으로 LoRA 어댑터를 달아 보상 모델을 파라미터 효율적으로 훈련할 수 있어요. 큰 모델에서 특히 유용해요.

더 알아보기