PPO 논문 — 클리핑 정책 경사 목적 함수

PPO 논문 — 클리핑 정책 경사 목적 함수

"Proximal Policy Optimization Algorithms"(arXiv:1707.06347)은 OpenAI가 발표한 PPO 원본 논문이에요.

동기

정책 경사 방법(예: A2C, TRPO)은 갱신 스텝 크기(학습률)에 민감해 불안정하거나 느렸다. TRPO는 신뢰 영역 제약으로 안정성을 얻지만 구현이 복잡하다. PPO는 훨씬 단순한 클리핑 목적 함수로 같은 안정성을 얻는다.

세 가지 변형

논문은 PPO를 세 가지로 제시한다:

  1. 클리핑 목적 함수(clipped surrogate): 확률비가 [1-ε, 1+ε] 밖으로 나가면 기여도를 낮춘다(핵심).
  2. 적응형 KL 페널티: KL 발산에 페널티를 주고, 발산이 기준을 벗어나면 페널티 계수를 조절한다.
  3. 방식 비교 끝에 클리핑 방식이 최고였음을 보인다.

결과

MuJoCo·Atari 등에서 TRPO·A2C를 능가하거나 맞먹으면서 구현이 단순하고 샘플 효율이 좋아, 이후 RLHF에서도 사실상 표준이 된다.

더 알아보기