TRL 퀵스타트 — SFT·보상·GRPO 파이프라인
TRL 퀵스타트 — SFT·보상·GRPO 파이프라인
TRL 퀵스타트는 post-training 파이프라인을 가장 짧은 코드로 체험하게 해줘요. 지시 튜닝(SFT)부터 보상 사용(GRPO/DPO)까지 자연스럽게 확장돼요.
SFT (지시 파인튜닝)
from trl import SFTTrainer
trainer = SFTTrainer(
model="Qwen/Qwen2.5-0.5B",
train_dataset=load_dataset("trl-lib/Capybara", split="train"),
)
trainer.train()
보상 기반 정렬
GRPO는 보상 모델 없이 그룹 상대 비교로 어드밴티지를 계산하고, DPO는 선호를 직접 손실로 치환해요. 보상 모델링은 이런 후속 정렬의 기반이 되죠.
보상 모델링과의 연결
보상 모델이 "무엇이 좋은지"의 점수 함수라면, GRPO/DPO는 그 선호를 정책에 반영하는 단계예요. 연결고리를 이해하면 post-training 전체 그림이 보여요.
트러블슈팅
- OOM:
per_device_train_batch_size=1·gradient_accumulation_steps=8로 시작. - loss 미수렴: 학습률을 2e-5 근처로 조정.