TRL — Transformers 강화학습(RL) 라이브러리

TRL

TRL(Transformers Reinforcement Learning)은 허깅페이스가 만든 full-stack 강화학습 라이브러리예요. SFT(지도 파인튜닝), GRPO, DPO 같은 선호 최적화, 보상 모델링 등 다양한 포스트트레이닝 기법으로 Transformer 언어 모델을 훈련하는 도구를 제공해요. transformers와 긴밀하게 통합되어 있어요.

이 카테고리는 TRL 공식 문서를 반영한 한국어 가이드 문서 모음이에요.

출처: 공식 문서 (신규 시드 허브)