verl PPO 문서 — 분산 RL 학습에서의 PPO
verl PPO 문서 — 분산 RL 학습에서의 PPO
verl 은 PPO를 기본 지원하는 대규모 LLM RL 프레임워크예요. RLHF에서 PPO는 일반화 전통적인 흐름이에요.
verl에서 PPO 흐름
- 롤아웃(rollout): 정책 모델이 프롬프트에 응답을 생성하고, 리워드 모델이 보상·KL 페널티를 매겨요.
- 크리틱(critic): PPO는 값 함수(critic)가 필요하므로, 정책과 별도 크리틱/리워드 모델을 함께 학습해요.
- 어드밴티지 계산: GAE(Generalized Advantage Estimation)로 어드밴티지를 산출해 정책을 클리핑 갱신한다.
엔진 분리
verl의 제어 흐름과 계산 엔진 분리 덕에, PPO 훈련 루프는 유지한 채 액터·크리틱 엔진을 FSDP, Megatron-LM 등으로 바꿔 실행할 수 있어요. 저장공간·통신 최적화로 대규모 롤아웃을 효율 처리해요.
실전
trainer/main_ppo.py 진입점을 보고, vLLM/SGLang으로 rollout을, FSDP/Megatron으로 학습을 배치해 실행하면 돼요. 수학·코딩·정책 최적화 과제에 널리 쓰여요.