verl GRPO 문서 — 분산 GRPO 실행

verl GRPO 문서 — 분산 GRPO 실행

verl 에서 Group Relative Policy Optimization(GRPO) 은 핵심 지원 알고리즘이에요. verl의 데이터플로·하이브리드 컨트롤러 설계 덕분에, 그룹 보상 기반 어드밴티지를 한 번에 쉽게 코드로 표현할 수 있어요.

GRPO를 verl에서

  • 정책 모델이 프롬프트마다 여러 샘플(그룹) 을 생성하고, 리워드 모델이 각 샘플의 보상을 매겨요.
  • 어드밴티지는 그룹 내 상대 보상으로 산출되며, clip을 이용한 정책 갱신으로 샘플 효율을 유지해요.
  • verl은 이 흐름을 계산 엔진(FSDP/Megatron)과 제어 흐름을 분리해 표현하므로, 같은 GRPO 루프를 여러 백엔드 위에서 돌릴 수 있어요.

실전

trainer/main_ppo.py 류 진입점에서 GRPO 옵션을 켜고, vLLM·SGLang으로 rollout을, FSDP/Megatron으로 정책·리워드 학습을 배치해 실행해요. R1 스타일 수학·코딩 강화 훈련에 널리 쓰여요.

더 알아보기