TRL 개요 — 학습 방법과 분류

TRL 개요

TRL은 트랜스포머 언어 모델을 SFT, GRPO, DPO, 보상 모델링 등 다양한 방법으로 훈련할 수 있는 full-stack 라이브러리예요. transformers와 통합되어 있어서 익숙한 Trainer 패턴으로 포스트트레이닝을 할 수 있어요.

출처: TRL 문서

분류(Taxonomy)

온라인(Online) 방법

  • GRPO: Group Relative Policy Optimization. 보상 함수 기반 온라인 RL
  • PPO: 정책 그래디언트 기반 온라인 RL

오프라인(Offline) 방법

  • SFT: Supervised Fine-Tuning. 지도 파인튜닝
  • DPO: Direct Preference Optimization. 선호 쌍 기반 직접 최적화
  • Reward modeling: RewardTrainer로 선호 데이터에서 보상 모델 훈련

실험적 방법

  • 지식 증류(knowledge distillation) 등

문서 구조

  • 시작하기(Getting Started): 설치와 퀵스타트 가이드
  • 개념 가이드(Conceptual Guides): 데이터셋 포맷, 훈련 FAQ, 로그 이해
  • 방법 가이드(How-to Guides): 메모리 절약, 훈련 가속, 분산 훈련
  • 통합(Integrations): DeepSpeed, Liger Kernel, PEFT 등
  • 예시(Examples): 예제 개요, 커뮤니티 튜토리얼
  • API: 트레이너, 유틸리티

TRL 관련 모델·데이터셋·데모는 TRL Hugging Face organization에서 찾아볼 수 있어요.

더 알아보기