TRL Reward Modeling — 보상 모델과 브래들리-테리 손실

TRL Reward Modeling — 보상 모델과 브래들리-테리 손실

TRL은 Outcome-supervised Reward Modeling(ORM) 트레이너 RewardTrainer 로 보상 모델을 훈련해요. 보상 모델은 선호·비선호 응답 쌍 데이터로 학습돼 선호 응답에 더 높은 점수를 부여해요.

브래들리-테리 모델

보상 함수 r이 주어질 때, y+가 y-보다 선호될 확률은 시그모이드로 표현돼요.

p(y+ ≻ y- | x) = σ(r(x,y+) - r(x,y-))

보상 모델은 관찰된 선호의 음의 로그우도를 최소화하며 학습해요. 즉 좋은 응답을 높이고 나쁜 응답을 낮추는 방향으로 점수를 맞춰요.

데이터 형식

대화형 데이터셋은 채팅 템플릿이 자동 적용되고, 사전 토큰화 데이터는 input_ids_chosen/input_ids_rejected 같은 열을 요구해요. 표준 선호 데이터(chosen/rejected)가 기본이에요.

보상 해킹과 중앙화

보상에 상수를 더해도 선호 확률이 안 바뀌는 비결정성(Bradley-Terry underdetermination)을 막기 위해, 보상이 0을 중심으로 하도록 center_rewards_coefficient 를 지원해요.

더 알아보기