BentoCloud 배포와 개발 가이드
BentoCloud 배포와 개발 가이드
OpenLLM은 로컬 서빙뿐 아니라 클라우드 배포까지 지원해요. BentoML을 통한 LLM 클라우드 배포와, 기여자를 위한 개발 가이드를 정리해요.
BentoCloud로 배포
OpenLLM은 BentoML(통합 모델 서빙 프레임워크)과 BentoCloud(엔터프라이즈 AI 추론 플랫폼)를 통해 LLM을 클라우드에 배포할 수 있어요. BentoCloud는 LLM 추론에 최적화된 완전 관리형 인프라로, 오토스케일링·모델 오케스트레이션·관측성을 제공해요.
BentoCloud에 가입·로그인한 뒤 openllm deploy로 배포해요.
openllm deploy llama3.2:1b --env HF_TOKEN
게이티드 모델을 배포한다면 환경 변수에 HF_TOKEN을 설정해야 해요. 배포가 끝나면 BentoCloud 콘솔에서 모델 추론을 실행할 수 있어요.
개발 환경 설정
개발에 참여하려면 먼저 환경을 준비해요.
git clone [email protected]:username/OpenLLM.git && cd openllm
git remote add upstream [email protected]:bentoml/OpenLLM.git
git switch main
git fetch upstream --tags
git branch --set-upstream-to=upstream/main
Git과 Python 3.8+가 설치되어 있어야 해요.
새 모델 추가
recipe.yaml에 해당 LLM의 Bento를 생성하기 위한 메타데이터를 넣어요.
"<model_name>:<model_tag>":
project: vllm-chat
service_config:
name: phi3
traffic:
timeout: 300
resources:
gpu: 1
gpu_type: nvidia-tesla-l4
engine_config:
model: microsoft/Phi-3-mini-4k-instruct
max_model_len: 4096
dtype: half
chat_template: phi-3
<model_name>은 지원하는 모델 유형(phi3, llama2, llama3, gemma 등)이에요.<model_tag>는<model_size>-<model_type>-<precision>[-<quantization>]규칙을 따라요. 예:microsoft/Phi-3-mini-4k-instruct→3.8b-instruct-fp16.service_config는 BentoML 관련 설정,engine_config는 vLLM 엔진 인자를 담아요.model,max_model_len,dtype,trust_remote_code는 항상 포함하는 걸 권장해요.
그다음 make.py로 Bento를 생성해요.
BENTOML_HOME=$(openllm repo default)/bentoml/bentos python make.py <model_name>:<model_tag>
더 알아보기
- 시작하기: Getting Started
- 지원 모델: Supported models
- 개발자 가이드 원문: Developer Guide