PPO 논문 — 클리핑 정책 경사 목적 함수
PPO 논문 — 클리핑 정책 경사 목적 함수
"Proximal Policy Optimization Algorithms"(arXiv:1707.06347)은 OpenAI가 발표한 PPO 원본 논문이에요.
동기
정책 경사 방법(예: A2C, TRPO)은 갱신 스텝 크기(학습률)에 민감해 불안정하거나 느렸다. TRPO는 신뢰 영역 제약으로 안정성을 얻지만 구현이 복잡하다. PPO는 훨씬 단순한 클리핑 목적 함수로 같은 안정성을 얻는다.
세 가지 변형
논문은 PPO를 세 가지로 제시한다:
- 클리핑 목적 함수(clipped surrogate): 확률비가
[1-ε, 1+ε]밖으로 나가면 기여도를 낮춘다(핵심). - 적응형 KL 페널티: KL 발산에 페널티를 주고, 발산이 기준을 벗어나면 페널티 계수를 조절한다.
- 방식 비교 끝에 클리핑 방식이 최고였음을 보인다.
결과
MuJoCo·Atari 등에서 TRPO·A2C를 능가하거나 맞먹으면서 구현이 단순하고 샘플 효율이 좋아, 이후 RLHF에서도 사실상 표준이 된다.