GRPO — 크리틱 없이 그룹 내 상대 보상으로 정책 최적화

Group Relative Policy Optimization (GRPO)

PPO에서 값 함숫값(critic)과 같은 크기의 별도 모델을 키우는 비용이 커요. GRPO(Group Relative Policy Optimization) 는 짐단(그룹) 샘플들의 상대적 평균 보상을 기준(baseline)으로 삼아, 크리틱 모델 없이 정책을 최적화하는 방법이에요. DeepSeek이 제안하고 DeepSeek-R1 훈련에 사용하며, verl 같은 RL 프레임워크에 표준으로 들어있어요.

이 카테고리의 문서

  • 개요: DeepSeekMath 논문 — GRPO 제안
  • 핵심 기능: verl GRPO 문서 — 분산 GRPO 실행
  • 실전·API: DeepSeek-R1 리포트 — R1 훈련에서의 GRPO

출처: https://arxiv.org/abs/2402.03300