DeepSeek-R1 리포트 — R1 훈련 파이프라인의 GRPO
DeepSeek-R1 리포트 — R1 훈련 파이프라인의 GRPO
DeepSeek-R1 은 오픈소스 추론 모델로, 강화학습 관점에서 GRPO 를 대규모로 사용한 대표적 사례예요. R1-Zero는 RL만으로, R1은 RL + 콜드 스타트 + 거부 샘플링 SFT로 추론 능력을 끌어올려요.
GRPO 사용처
- DeepSeek-R1-Zero: 사전 학습 모델에 바로 GRPO RL을 적용해, 사람 지도 데이터 없이도('아하' 순간) 추론·자가 검증·반성 같은 행동이 자생적으로 나타나는 걸 보여줘요.
- 리워드 모델링: 정확성(결정적 보상)과 형식·언어 일관성(규칙 기반)을 결합한 리워드로 GRPO를 돌려요.
- R1에서는 RL과 함께 품질 필터링·콜드 스타트 데이터로 안정성을 높였어요.
왜 GRPO냐
수학·코딩처럼 그룹으로 샘플링하고 상대 보상으로 평가하기 좋은 과제에서, critic 없이도 안정적이고 경제적인 정책 갱신이 가능해졌어요.