인간 피드백 기반 강화학습

인간 피드백 기반 강화학습 (RLHF)

RLHF(Reinforcement Learning from Human Feedback)는 인간이 만든 선호(preference) 데이터로 언어 모델을 미세 조정해, 모델 출력을 원하는 행동에 정렬시키는 기법입니다. vLLM은 RLHF에서 완성(completion) 생성을 위해 사용될 수 있습니다.

출처: 문서

본문

RLHF(인간 피드백 기반 강화학습)는 인간이 생성한 선호 데이터로 언어 모델을 미세 조정해 모델 출력을 원하는 행동에 정렬시키는 기법입니다. vLLM은 RLHF용 완성(completion)을 생성하는 데 사용될 수 있습니다.

다음 오픈소스 RL 라이브러리들이 빠른 rollout을 위해 vLLM을 사용합니다(알파벳순, 비포괄적):

학습과 추론 간 가중치 동기화에 대해서는 Weight Transfer 문서를 참고하세요. 이 문서는 NCCL(멀티 GPU)과 IPC(단일 GPU) 엔진을 다루는 플러그형 백엔드 시스템을 설명합니다.

GPU 활용과 처리량을 높이기 위해 생성과 학습을 파이프라이닝하려면 Async Reinforcement Learning 가이드를 참고하세요. 이 가이드는 진행 중에 안전하게 가중치를 업데이트하는 pause/resume API를 다룹니다.

vLLM을 GRPO에 사용하는 방법을 보여주는 노트북을 참고하세요:

더 알아보기 (Learn more)