BentoCloud 배포와 개발 가이드

BentoCloud 배포와 개발 가이드

OpenLLM은 로컬 서빙뿐 아니라 클라우드 배포까지 지원해요. BentoML을 통한 LLM 클라우드 배포와, 기여자를 위한 개발 가이드를 정리해요.

BentoCloud로 배포

OpenLLM은 BentoML(통합 모델 서빙 프레임워크)과 BentoCloud(엔터프라이즈 AI 추론 플랫폼)를 통해 LLM을 클라우드에 배포할 수 있어요. BentoCloud는 LLM 추론에 최적화된 완전 관리형 인프라로, 오토스케일링·모델 오케스트레이션·관측성을 제공해요.

BentoCloud에 가입·로그인한 뒤 openllm deploy로 배포해요.

openllm deploy llama3.2:1b --env HF_TOKEN

게이티드 모델을 배포한다면 환경 변수에 HF_TOKEN을 설정해야 해요. 배포가 끝나면 BentoCloud 콘솔에서 모델 추론을 실행할 수 있어요.

출처: https://github.com/bentoml/OpenLLM/blob/main/README.md

개발 환경 설정

개발에 참여하려면 먼저 환경을 준비해요.

git clone [email protected]:username/OpenLLM.git && cd openllm
git remote add upstream [email protected]:bentoml/OpenLLM.git
git switch main
git fetch upstream --tags
git branch --set-upstream-to=upstream/main

Git과 Python 3.8+가 설치되어 있어야 해요.

새 모델 추가

recipe.yaml에 해당 LLM의 Bento를 생성하기 위한 메타데이터를 넣어요.

"<model_name>:<model_tag>":
  project: vllm-chat
  service_config:
    name: phi3
    traffic:
      timeout: 300
    resources:
      gpu: 1
      gpu_type: nvidia-tesla-l4
  engine_config:
    model: microsoft/Phi-3-mini-4k-instruct
    max_model_len: 4096
    dtype: half
  chat_template: phi-3
  • <model_name>은 지원하는 모델 유형(phi3, llama2, llama3, gemma 등)이에요.
  • <model_tag><model_size>-<model_type>-<precision>[-<quantization>] 규칙을 따라요. 예: microsoft/Phi-3-mini-4k-instruct3.8b-instruct-fp16.
  • service_config는 BentoML 관련 설정, engine_config는 vLLM 엔진 인자를 담아요. model, max_model_len, dtype, trust_remote_code는 항상 포함하는 걸 권장해요.

그다음 make.py로 Bento를 생성해요.

BENTOML_HOME=$(openllm repo default)/bentoml/bentos python make.py <model_name>:<model_tag>

더 알아보기