Hugging Face에서 RL-Baselines3-Zoo 사용하기
Hugging Face에서 RL-Baselines3-Zoo 사용하기
rl-baselines3-zoo는 Stable Baselines3를 사용하는 강화학습(Reinforcement Learning)용 학습 프레임워크예요.
출처: 문서
본문
Hub에서 RL-Baselines3-Zoo 탐색하기
모델 페이지 왼쪽의 필터로 RL-Baselines3-Zoo 모델을 찾을 수 있어요.
Stable-Baselines3 팀은 하이퍼파라미터가 튜닝된 150개 이상의 강화학습 에이전트 컬렉션을 여기에서 호스팅하고 있어요.
Hub의 모든 모델은 유용한 기능을 제공해요.
- 설명, 학습 구성 등을 담은 자동 생성 모델 카드
- 발견 가능성(discoverability)을 높여주는 메타데이터 태그
- 다른 모델과 비교할 수 있는 평가 결과
- 에이전트가 동작하는 모습을 볼 수 있는 비디오 위젯
기존 모델 사용하기
load_from_hub를 사용하면 Hub에서 모델을 간단히 다운로드할 수 있어요.
# ppo SpaceInvadersNoFrameskip-v4 모델을 다운로드해 logs/ 폴더에 저장
python -m rl_zoo3.load_from_hub --algo dqn --env SpaceInvadersNoFrameskip-v4 -f logs/ -orga sb3
python enjoy.py --algo dqn --env SpaceInvadersNoFrameskip-v4 -f logs/
세 가지 파라미터를 정의할 수 있어요.
--repo-name: 저장소 이름-orga: Hugging Face 사용자 이름 또는 조직-f: 저장 폴더
모델 공유하기
push_to_hub로 모델을 쉽게 업로드할 수 있어요. 이 명령은 모델을 저장하고, 평가하고, 모델 카드를 생성하고, 에이전트의 재생(replay) 비디오를 기록한 다음 전체 저장소를 Hub에 푸시해요.
python -m rl_zoo3.push_to_hub --algo dqn --env SpaceInvadersNoFrameskip-v4 --repo-name dqn-SpaceInvadersNoFrameskip-v4 -orga ThomasSimonini -f logs/
세 가지 파라미터를 정의할 수 있어요.
--repo-name: 저장소 이름-orga: Hugging Face 사용자 이름-f: 모델이 저장된 폴더
추가 리소스
더 알아보기 (Learn more)
load_from_hub로 기존 에이전트를 바로 가져와 즐길 수 있고, push_to_hub는 평가·모델 카드·재생 비디오까지 자동 생성해 공유 흐름을 매끄럽게 만들어 줘요. 스테이블한 하이퍼파라미터 튜닝 모델 모음은 sb3 조직에서 찾을 수 있어요.