OpenRLHF — Ray와 vLLM 기반의 대규모 RLHF 프레임워크
OpenRLHF — Ray와 vLLM 기반의 대규모 RLHF 프레임워크
OpenRLHF는 Ray 클러스터와 vLLM 분산 구성을 바탕으로 RLHF(인간 피드백 기반 강화학습)를 대규모로 돌리기 위한 오픈소스 프레임워크예요. SFT·Reward Model·DPO 같은 지도·선호 학습과 PPO·GRPO·REINFORCE++ 계열 RL 학습을 모두 지원해요.
싱글 턴 보상과 멀티 턴 에이전트, HTTP 원격 RM, 커스텀 파이썬 보상 함수(Reinforced Fine-Tuning)까지 폭넓게 다루고, "일단 실행하고 이해하고 최적화하라"는 접근을 권해요. 아래에서 개요, 빠른 시작, RL 학습 가이드를 살펴볼게요.