verl 문서 — 유연하고 효율적인 RL 훈련 프레임워크

verl 문서 — 유연하고 효율적인 RL 훈련 프레임워크

verl 은 대규모 LLM의 RL 사후 훈련을 위한 프레임워크예요. HybridFlow 논문([1] arXiv:2409.19256)의 공개 구현이에요. 핵심 슬로건은 유연성(flexible)효율(efficient), 프로덕션 준비(production-ready) 예요.

주요 특징

  • 모듈형 API로 기존 LLM 인프라와 매끄럽게 통합: PyTorch FSDP, Megatron-LM, vLLM, SGLang과 조합해요.
  • 유연한 디바이스 배치·병렬: 모델을 다른 GPU 그룹에 배치해 클러스터 크기별로 자원을 효율 활용해요.
  • Hugging Face 모델 바로 지원: 사전 학습 모델을 그대로 올려 RL을 돌려요.
  • 다양한 RL 알고리즘: PPO, GRPO를 기본 지원하고, 버전에 따라 더 많은 알고리즘을 실어나가요.

문서 구성

설치·요구사항부터 알고리즘(PPO/GRPO), 워커(Ray 트레이너·모델 엔진), 성능 튜닝, 확장(backend 추가)까지 체계적으로 다뤄져요.

더 알아보기