보상 모델
보상 모델 (Reward models)
이 페이지는 스칼라 보상 점수나 분류 결과를 출력하는 보상 모델을 설명해요. 이 모델들은 강화 학습이나 콘텐츠 조정 작업에서 자주 사용돼요. --is-embedding으로 실행되며 일부는 --trust-remote-code가 필요할 수 있어요.
출처: 문서
본문
이 모델들은 스칼라 보상 점수 또는 분류 결과를 출력하며, 강화 학습이나 콘텐츠 조정 작업에서 자주 사용돼요.
--is-embedding으로 실행되며 일부 모델은 --trust-remote-code가 필요할 수 있어요.
예시 실행 명령 (Example launch Command)
python3 -m sglang.launch_server \
--model-path Qwen/Qwen2.5-Math-RM-72B \ # example HF/local path
--is-embedding \
--host 0.0.0.0 \
--tp-size=4 \ # set for tensor parallelism
--port 30000 \
지원 모델 (Supported models)
| Model Family (Reward) | Example HuggingFace Identifier | Description |
|---|---|---|
Llama (3.1 Reward / LlamaForSequenceClassification) |
Skywork/Skywork-Reward-Llama-3.1-8B-v0.2 |
Llama 3.1(8B) 기반 보상 모델(선호 분류기)로, RLHF용 응답 스코어링과 랭킹에 사용. |
Gemma 2 (27B Reward / Gemma2ForSequenceClassification) |
Skywork/Skywork-Reward-Gemma-2-27B-v0.2 |
Gemma‑2(27B)에서 파생된 모델로, RLHF와 다국어 작업에 인간 선호 스코어링 제공. |
InternLM 2 (Reward / InternLM2ForRewardMode) |
internlm/internlm2-7b-reward |
InternLM 2(7B) 기반 보상 모델로, 정렬 파이프라인에서 출력을 선호 동작으로 안내. |
Qwen2.5 (Reward - Math / Qwen2ForRewardModel) |
Qwen/Qwen2.5-Math-RM-72B |
Qwen2.5 시리즈의 수학 특화 72B RLHF 보상 모델로, 응답 평가와 개선에 튜닝됨. |
Qwen2.5 (Reward - Sequence / Qwen2ForSequenceClassification) |
jason9693/Qwen2.5-1.5B-apeach |
시퀀스 분류에 사용되는 더 작은 Qwen2.5 변형으로, 대안적 RLHF 스코어링 메커니즘 제공. |