Llama 3.1 8B 배포 튜토리얼

Llama 3.1 8B 배포 튜토리얼

Anyscale CLI로 Llama 3.1 8B 모델을 서비스로 띄우고 쿼리하는 전형적인 흐름이에요. Ray Serve와 vLLM을 사용합니다.

출처: https://docs.anyscale.com/tutorials/deploy-an-llm

1. CLI 설치·로그인

pip install -U anyscale
anyscale login

2. 예제 클론 후 배포

게이트(gated) 모델(Llama 3 등)은 인증에 Hugging Face 토큰이 필요해요.

git clone https://github.com/anyscale/examples.git
cd examples/deploy_llama_3_8b

export HF_TOKEN=<INSERT HUGGING FACE TOKEN HERE>
anyscale service deploy -f service.yaml --env HF_TOKEN=$HF_TOKEN

게이트되지 않은 모델을 쓰면 앱의 LLMConfig에서 model_source를 해당 모델로 바꾸고 Hugging Face 토큰을 빼면 됩니다.

3. 이해해야 할 설정

  • accelerator_type="L4"로 가속기 타입을 지정해요. 다른 가속기를 쓰려면 지원 목록에서 이름을 골라 바꾸면 됩니다.
  • Ray Serve는 min_replicas~max_replicas 사이에서 대기열 길이를 보고 레플리카 수를 자동 스케일합니다.
  • 예제는 vLLM을 쓰고, Dockerfile이 서비스 의존성을 정의해요.

4. 서비스 쿼리

anyscale service deploy는 이런 형태의 커맨드를 출력해요.

curl -H "Authorization: Bearer <SERVICE_TOKEN>" <BASE_URL>

여기서 SERVICE_TOKEN과 BASE_URL을 뽑아 쿼리 스크립트에 넣고 OpenAI 방식으로 호출합니다.

pip install openai
python query.py

5. 종료

anyscale service terminate -n deploy-llama-3-1-8b

더 알아보기

  • https://docs.anyscale.com/tutorials/deploy-llama-3-1-70b — 70B 배포(텐서 병렬)
  • https://docs.anyscale.com/llm/serving — LLM 서빙 개요