보상 모델

보상 모델 (Reward models)

이 페이지는 스칼라 보상 점수나 분류 결과를 출력하는 보상 모델을 설명해요. 이 모델들은 강화 학습이나 콘텐츠 조정 작업에서 자주 사용돼요. --is-embedding으로 실행되며 일부는 --trust-remote-code가 필요할 수 있어요.

출처: 문서

본문

이 모델들은 스칼라 보상 점수 또는 분류 결과를 출력하며, 강화 학습이나 콘텐츠 조정 작업에서 자주 사용돼요.

--is-embedding으로 실행되며 일부 모델은 --trust-remote-code가 필요할 수 있어요.

예시 실행 명령 (Example launch Command)

python3 -m sglang.launch_server \
  --model-path Qwen/Qwen2.5-Math-RM-72B \  # example HF/local path
  --is-embedding \
  --host 0.0.0.0 \
  --tp-size=4 \                          # set for tensor parallelism
  --port 30000 \

지원 모델 (Supported models)

Model Family (Reward) Example HuggingFace Identifier Description
Llama (3.1 Reward / LlamaForSequenceClassification) Skywork/Skywork-Reward-Llama-3.1-8B-v0.2 Llama 3.1(8B) 기반 보상 모델(선호 분류기)로, RLHF용 응답 스코어링과 랭킹에 사용.
Gemma 2 (27B Reward / Gemma2ForSequenceClassification) Skywork/Skywork-Reward-Gemma-2-27B-v0.2 Gemma‑2(27B)에서 파생된 모델로, RLHF와 다국어 작업에 인간 선호 스코어링 제공.
InternLM 2 (Reward / InternLM2ForRewardMode) internlm/internlm2-7b-reward InternLM 2(7B) 기반 보상 모델로, 정렬 파이프라인에서 출력을 선호 동작으로 안내.
Qwen2.5 (Reward - Math / Qwen2ForRewardModel) Qwen/Qwen2.5-Math-RM-72B Qwen2.5 시리즈의 수학 특화 72B RLHF 보상 모델로, 응답 평가와 개선에 튜닝됨.
Qwen2.5 (Reward - Sequence / Qwen2ForSequenceClassification) jason9693/Qwen2.5-1.5B-apeach 시퀀스 분류에 사용되는 더 작은 Qwen2.5 변형으로, 대안적 RLHF 스코어링 메커니즘 제공.

더 알아보기