TRL 개요 — 학습 방법과 분류
TRL 개요
TRL은 트랜스포머 언어 모델을 SFT, GRPO, DPO, 보상 모델링 등 다양한 방법으로 훈련할 수 있는 full-stack 라이브러리예요. transformers와 통합되어 있어서 익숙한 Trainer 패턴으로 포스트트레이닝을 할 수 있어요.
출처: TRL 문서
분류(Taxonomy)
온라인(Online) 방법
- GRPO: Group Relative Policy Optimization. 보상 함수 기반 온라인 RL
- PPO: 정책 그래디언트 기반 온라인 RL
오프라인(Offline) 방법
- SFT: Supervised Fine-Tuning. 지도 파인튜닝
- DPO: Direct Preference Optimization. 선호 쌍 기반 직접 최적화
- Reward modeling:
RewardTrainer로 선호 데이터에서 보상 모델 훈련
실험적 방법
- 지식 증류(knowledge distillation) 등
문서 구조
- 시작하기(Getting Started): 설치와 퀵스타트 가이드
- 개념 가이드(Conceptual Guides): 데이터셋 포맷, 훈련 FAQ, 로그 이해
- 방법 가이드(How-to Guides): 메모리 절약, 훈련 가속, 분산 훈련
- 통합(Integrations): DeepSpeed, Liger Kernel, PEFT 등
- 예시(Examples): 예제 개요, 커뮤니티 튜토리얼
- API: 트레이너, 유틸리티
TRL 관련 모델·데이터셋·데모는 TRL Hugging Face organization에서 찾아볼 수 있어요.