포스트 트레이닝 레시피 — SFT 실행 예시
포스트 트레이닝 레시피 — SFT 실행 예시
이미 만든 모델을 재현·확장하고 싶다면 저장소의 레시피가 좋은 출발점이에요. slurm 스크립트로 모델·태스크·설정·가속기를 넘겨 SFT를 실행하는 예시를 볼게요.
출처: https://github.com/huggingface/open-r1/blob/main/recipes/README.md
OpenR1 Distill 7B
sbatch --nodes=1 slurm/train.slurm --model OpenR1-Distill-7B --task sft --config distill --accelerator zero3
OlympicCoder
# 7B
sbatch --nodes=1 slurm/train.slurm --model OlympicCoder-7B --task sft --config v00.00 --accelerator zero3
# 32B
sbatch --nodes=16 slurm/train.slurm --model OlympicCoder-32B --task sft --config v00.00 --accelerator fsdp
참고로 32B 모델에서는 최대한 큰 컨텍스트 크기를 넣기 위해 FSDP1과 paged AdamW 8-bit로 전환하는 게 필요하다는 점을 발견했어요.