인간 피드백 강화학습
인간 피드백 강화학습 (Reinforcement Learning from Human Feedback)
LLM을 "더 좋은 방향"으로 정렬하고 싶을 때, 사람이 만든 선호(preference) 데이터로 모델을 미세조정하는 기법이 있어요. 그게 바로 RLHF(Renforcement Learning from Human Feedback)입니다. 이 문서는 RLHF에서 완성(completions)을 생성하는 데 vLLM을 어떻게 쓰는지 간단히 안내해요.
RLHF란 무엇인가
RLHF(Reinforcement Learning from Human Feedback)는 사람이 생성한 선호 데이터를 사용해 언어 모델을 미세조정함으로써 모델 출력을 원하는 동작에 정렬(align)하는 기법이에요. vLLM은 RLHF를 위한 완성을 생성하는 데 사용될 수 있습니다.
다음의 오픈소스 RL 라이브러리들이 빠른 롤아웃을 위해 vLLM을 사용해요(알파벳순, 비전체 목록):
훈련과 추론 사이의 가중치 동기화에 대해서는 Weight Transfer 문서를 참고하세요. 이 문서는 NCCL(멀티 GPU) 및 IPC(동일 GPU) 엔진을 다루는 플러그형 백엔드 시스템을 설명해요.
GPU 활용률과 처리량을 높이기 위해 생성과 훈련을 파이프라인으로 묶으려면 Async Reinforcement Learning 가이드를 참고하세요. 이 가이드는 가중치를 도중에 안전하게 갱신하기 위한 pause/resume API를 다룹니다.
vLLM으로 GRPO를 사용하는 방법을 보여주는 노트북들은 다음과 같아요.