GRPO — 크리틱 없이 그룹 내 상대 보상으로 정책 최적화
Group Relative Policy Optimization (GRPO)
PPO에서 값 함숫값(critic)과 같은 크기의 별도 모델을 키우는 비용이 커요. GRPO(Group Relative Policy Optimization) 는 짐단(그룹) 샘플들의 상대적 평균 보상을 기준(baseline)으로 삼아, 크리틱 모델 없이 정책을 최적화하는 방법이에요. DeepSeek이 제안하고 DeepSeek-R1 훈련에 사용하며, verl 같은 RL 프레임워크에 표준으로 들어있어요.
이 카테고리의 문서
- 개요: DeepSeekMath 논문 — GRPO 제안
- 핵심 기능: verl GRPO 문서 — 분산 GRPO 실행
- 실전·API: DeepSeek-R1 리포트 — R1 훈련에서의 GRPO