TRL 개요 — post-training 풀스택 라이브러리
TRL 개요 — post-training 풀스택 라이브러리
TRL(Transformers Reinforcement Learning) 은 트랜스포머 언어 모델을 post-training 하는 풀스택 라이브러리예요. SFT·GRPO·DPO·보상 모델링 등을 트레이너로 제공하고, 🤗Transformers와 긴밀하게 통합돼요.
다루는 방법
- SFT (Supervised Fine-Tuning): 지시 데이터로 지도 학습. instruction tuning의 근간.
- GRPO: 보상 모델 없이 그룹 상대 비교로 어드밴티지를 계산하는 강화학습.
- DPO: RLHF를 단순한 선호 분류 손실로 치환.
- 보상 모델링: 인간 선호 점수를 주는 모델 훈련.
생태계
데이터셋·모델·데모는 TRL Hugging Face 조직에 모여 있어요. DeepSpeed·Liger Kernel·PEFT 통합 등도 갖춰져 있고, 사용법을 배울 수 있는 공식 코스(smol course)도 운영돼요.
왜 중요한가
사전학습 모델만으로는 지시 수행이 어려워요. instruction tuning은 RLHF·DPO까지 가는 정렬 파이프라인의 출발점으로, 오늘날 모든 지시 모델이 거치는 첫 단계예요.