DeepSeekMath 논문 — GRPO 제안과 수학 추론
DeepSeekMath 논문 — GRPO 제안과 수학 추론
DeepSeek-Math은 수학 추론 능력 향상과 RL휴먼 피드백(RLHF) 확장을 목표로 한 시리즈로, GRPO(Group Relative Policy Optimization) 알고리즘을 제안했어요.
왜 GRPO인가
PPO 계열은 정책(policy)과 같은 크기의 값 함수(critic) 모델을 함께 학습해 큰 메모리·계산 비용을 지불해요. GRPO는 critic을 없애고, 같은 프롬프트에 대해 정책이 생성한 그룹(짐단) 출력들의 평균 보상을 기준(baseline) 으로 삼아 어드밴티지를 계산해요. 그래서 PPO의 안정성을 유지하면서도 리소스를 크게 아껴요.
어드밴티지 계산
각 출력의 어드밴티지는 그 자신의 보상에서 그룹 보상 평균을 뺀 값을 그룹 표준편차로 나눠 정규화하는 식으로 계산되요. 그룹이 클수록 기준이 더 단단해져요.
결과
GRPO 기반 DeepSeekMath 모델(RL허브에서 수학 과제 RL)이 GSM8K와 MATH에서 타 모델을 크게 앞섰고, 오픈소스 기준으로 수학 성능을 크게 끌어올렸어요.