Llama 3.1 8B 배포 튜토리얼
Llama 3.1 8B 배포 튜토리얼
Anyscale CLI로 Llama 3.1 8B 모델을 서비스로 띄우고 쿼리하는 전형적인 흐름이에요. Ray Serve와 vLLM을 사용합니다.
1. CLI 설치·로그인
pip install -U anyscale
anyscale login
2. 예제 클론 후 배포
게이트(gated) 모델(Llama 3 등)은 인증에 Hugging Face 토큰이 필요해요.
git clone https://github.com/anyscale/examples.git
cd examples/deploy_llama_3_8b
export HF_TOKEN=<INSERT HUGGING FACE TOKEN HERE>
anyscale service deploy -f service.yaml --env HF_TOKEN=$HF_TOKEN
게이트되지 않은 모델을 쓰면 앱의 LLMConfig에서 model_source를 해당 모델로 바꾸고 Hugging Face 토큰을 빼면 됩니다.
3. 이해해야 할 설정
accelerator_type="L4"로 가속기 타입을 지정해요. 다른 가속기를 쓰려면 지원 목록에서 이름을 골라 바꾸면 됩니다.- Ray Serve는
min_replicas~max_replicas사이에서 대기열 길이를 보고 레플리카 수를 자동 스케일합니다. - 예제는 vLLM을 쓰고, Dockerfile이 서비스 의존성을 정의해요.
4. 서비스 쿼리
anyscale service deploy는 이런 형태의 커맨드를 출력해요.
curl -H "Authorization: Bearer <SERVICE_TOKEN>" <BASE_URL>
여기서 SERVICE_TOKEN과 BASE_URL을 뽑아 쿼리 스크립트에 넣고 OpenAI 방식으로 호출합니다.
pip install openai
python query.py
5. 종료
anyscale service terminate -n deploy-llama-3-1-8b
더 알아보기
https://docs.anyscale.com/tutorials/deploy-llama-3-1-70b— 70B 배포(텐서 병렬)https://docs.anyscale.com/llm/serving— LLM 서빙 개요