RLHF 개요 — TRL로 모델 정렬 훈련하기

RLHF 개요

질문에 '사실은 맞는데 무례한' 답을 하는 모델, 들어보셨죠? 사전학습은 다음 토큰을 잘 맞추는 일만 하다 보니 정렬(alignment)이 빠져 있어요. RLHF는 여기에 인간의 선호를 보상 신호로 넣어 모델이 더 도움되고 안전한 답을 내도록 재학습하는 기법이에요.

TRL이라는 라이브러리

트랜스포머 강화학습을 뜻하는 TRL(Transformers Reinforcement Learning)은 이런 post-training 전과정을 한꺼번에 다루는 풀스택 라이브러리예요. SFT(지도 파인튜닝), GRPO, DPO, 보상 모델링 같은 방법을 트레이너로 제공하고, 🤗Transformers와 긴밀하게 연동돼요. 정렬 공부의 출발점으로 좋아요.

어떤 트레이너들이 있나

  • SFTTrainer: 지도 방식으로 지시 수행 능력 주입.
  • PPOTrainer: 전통적 RLHF — 보상 모델이 점수를 주면 정책을 갱신.
  • GRPOTrainer: 보상 모델 없이 그룹 내 상대 비교로 어드밴티지를 계산.
  • DPOTrainer: RLHF를 단순한 분류 손실로 치환.

왜 정렬이 필요한가

성능이 아무리 뛰어나도, 사용자 요구와 방향이 안 맞으면 실전에 못 써요. RLHF 계열은 그 '방향'을 사람의 취향 데이터로 잡아주는 방법이에요. DeepSeek-R1 같은 추론 모델들도 GRPO 같은 온라인 강화학습을 택하고 있어요.

더 알아보기