PPO — 클리핑으로 안정적인 정책 최적화

Proximal Policy Optimization (PPO)

PPO(Proximal Policy Optimization) 는 정책 경사(policy gradient)를 안정적으로 업데이트하는 대표적 강화학습 알고리즘이에요. 목적 함수를 클리핑(clip) 하여 한 번에 너무 크게 정책이 바뀌지 않게 막아, 하이퍼파라미터에 비교적 덜 민감하고 실무에서 검증된 선택지예요. RLHF의 토대이기도 해요.

이 카테고리의 문서

  • 개요: OpenAI Spinning Up — PPO 알고리즘·슈도코드
  • 핵심 기능: PPO 논문 — 클리핑 목적 함수
  • 실전·API: verl PPO 문서 — 분산 RL 학습에서의 PPO

출처: https://spinningup.openai.com/en/latest/algorithms/ppo.html