Hugging Face에서 RL-Baselines3-Zoo 사용하기

Hugging Face에서 RL-Baselines3-Zoo 사용하기

rl-baselines3-zoo는 Stable Baselines3를 사용하는 강화학습(Reinforcement Learning)용 학습 프레임워크예요.

출처: 문서

본문

Hub에서 RL-Baselines3-Zoo 탐색하기

모델 페이지 왼쪽의 필터로 RL-Baselines3-Zoo 모델을 찾을 수 있어요.

Stable-Baselines3 팀은 하이퍼파라미터가 튜닝된 150개 이상의 강화학습 에이전트 컬렉션을 여기에서 호스팅하고 있어요.

Hub의 모든 모델은 유용한 기능을 제공해요.

  1. 설명, 학습 구성 등을 담은 자동 생성 모델 카드
  2. 발견 가능성(discoverability)을 높여주는 메타데이터 태그
  3. 다른 모델과 비교할 수 있는 평가 결과
  4. 에이전트가 동작하는 모습을 볼 수 있는 비디오 위젯

기존 모델 사용하기

load_from_hub를 사용하면 Hub에서 모델을 간단히 다운로드할 수 있어요.

# ppo SpaceInvadersNoFrameskip-v4 모델을 다운로드해 logs/ 폴더에 저장
python -m rl_zoo3.load_from_hub --algo dqn --env SpaceInvadersNoFrameskip-v4 -f logs/ -orga sb3
python enjoy.py --algo dqn --env SpaceInvadersNoFrameskip-v4  -f logs/

세 가지 파라미터를 정의할 수 있어요.

  • --repo-name: 저장소 이름
  • -orga: Hugging Face 사용자 이름 또는 조직
  • -f: 저장 폴더

모델 공유하기

push_to_hub로 모델을 쉽게 업로드할 수 있어요. 이 명령은 모델을 저장하고, 평가하고, 모델 카드를 생성하고, 에이전트의 재생(replay) 비디오를 기록한 다음 전체 저장소를 Hub에 푸시해요.

python -m rl_zoo3.push_to_hub  --algo dqn  --env SpaceInvadersNoFrameskip-v4  --repo-name dqn-SpaceInvadersNoFrameskip-v4  -orga ThomasSimonini  -f logs/

세 가지 파라미터를 정의할 수 있어요.

  • --repo-name: 저장소 이름
  • -orga: Hugging Face 사용자 이름
  • -f: 모델이 저장된 폴더

추가 리소스

더 알아보기 (Learn more)

load_from_hub로 기존 에이전트를 바로 가져와 즐길 수 있고, push_to_hub는 평가·모델 카드·재생 비디오까지 자동 생성해 공유 흐름을 매끄럽게 만들어 줘요. 스테이블한 하이퍼파라미터 튜닝 모델 모음은 sb3 조직에서 찾을 수 있어요.