GPU를 연결해 서버 실행하기
GPU를 연결해 서버 실행하기
Petals는 커뮤니티 운영 시스템이라, 사람들이 GPU를 나눠 쓰는 게 핵심이에요. 내 GPU로 공개 모델의 일부 레이어를 호스팅할 수도 있고, 접근을 얻은 모델(Llama 등)은 로그인 후 호스팅할 수 있어요.
공개 모델 목록은 https://health.petals.dev 에서 확인할 수 있어요. 예시로 Llama 3.1(405B) Instruct의 일부를 GPU에 호스팅하는 방법을 볼게요. 리눅스 + Anaconda 기준 명령은 이래요.
conda install pytorch pytorch-cuda=11.7 -c pytorch -c nvidia
pip install git+https://github.com/bigscience-workshop/petals
python -m petals.cli.run_server meta-llama/Meta-Llama-3.1-405B-Instruct
Amd GPU는 공식 위키 안내를 따르면 돼요. Docker를 쓰면 NVIDIA GPU용 이미지로 바로 띄울 수 있어요.
sudo docker run -p 31330:31330 --ipc host --gpus all --volume petals-cache:/cache --rm \
learningathome/petals:main \
python -m petals.cli.run_server --port 31330 meta-llama/Meta-Llama-3.1-405B-Instruct
macOS + Apple M1/M2 GPU는 Homebrew를 설치한 뒤 이렇게 해요.
brew install python
python3 -m pip install git+https://github.com/bigscience-workshop/petals
python3 -m petals.cli.run_server meta-llama/Meta-Llama-3.1-405B-Instruct
10개 이상 블록을 로드해 호스팅하면 --public_name YOUR_NAME으로 스웜 모니터에 자기 이름을 남길 수 있어요. 보안상 서버를 호스팅해도 다른 사람이 내 컴퓨터에서 임의 코드를 실행할 수는 없어요.