DPO — 직접 선호 최적화로 모델 정렬하기

DPO

RLHF는 샘플링도 하고 보상 모델도 학습해야 해서 무겁고 불안정할 때가 많아요. **DPO(Direct Preference Optimization)**는 그 과정을 통째로 단순화해, 선호 쌍(좋은 답 vs 나쁜 답) 데이터만으로 참조 모델 대비 로그우도 차이를 벌리는 분류 손실로 정렬을 해결해요. TRL은 DPO뿐 아니라 ORPO·KTO 같은 후속 방법도 함께 제공해요.

이 카테고리의 문서

  • 핵심 기능: DPO Trainer — 선호 쌍으로 직접 정렬
  • 실전·API: ORPO — 참조 모델 없는 정렬
  • 응용: KTO — 선호 없이 이분 점수로 정렬

출처: https://huggingface.co/docs/trl/dpo_trainer