BentoML
BentoML
BentoML은 어떤 모델이든 어떤 클라우드에서든 배포·확장할 수 있게 도와주는 통합 추론 플랫폼이에요. 인프라 관리의 복잡함 없이 프로덕션 등급의 신뢰성으로 AI 모델을 배포하고 확장할 수 있게 해줘요. 커스텀 모델로 10배 빠르게 AI 시스템을 만들고, 클라우드에서 효율적으로 스케일하며, 보안·컴플라이언스에 대한 통제권을 유지할 수 있게 도와줘요.
출처: BentoML 공식 문서
시작하기
BentoML 오픈소스 모델 서빙 프레임워크는 PyPI에 Python 패키지로 배포돼요.
# Python 3.9+ 권장
pip install bentoml
클라우드 배포를 원한다면 BentoCloud에 가입해 무료 트라이얼을 받을 수 있어요.
핵심 개념 — Service와 Bento
BentoML로 AI API를 만들 때는 두 가지 개념이 중심이에요. Service는 모델 추론 로직을 담은 단위이고, Bento는 Service와 의존성, 설정을 묶어 배포 가능한 형태로 패키징한 결과물이에요.
Service를 정의하고 나면 bentoml build로 Bento를 만들고, 이 Bento를 어디서든(로컬, 도커, 클라우드) 실행해서 OpenAI 호환 API 같은 표준 인터페이스로 모델을 서빙할 수 있어요.
예시 워크플로우
BentoML은 다양한 사용 사례를 기본 예제로 제공해요.
- LLM 추론 (vLLM): OpenAI 호환 API와 vLLM 추론 백엔드로 오픈소스 LLM 엔드포인트를 서빙해요.
- RAG: 오픈소스 임베딩과 LLM으로 사설 RAG 시스템을 배포해요.
- 확산 모델: 유연한 커스터마이즈와 최적화된 배치 처리로 이미지 생성 API를 배포해요.
- ComfyUI: 대기열 실행으로 재현 가능한 워크플로우를 API로 자동화해요.
- LLM 안전 (ShieldGemma): Google의 안전 콘텐츠 모더레이션 모델로 LLM API 엔드포인트를 유해 입력에서 보호해요.
확장과 배포
BentoML은 프로덕션 배포를 위한 여러 기능을 갖추고 있어요.
- Online API Service 생성으로 커스텀 AI API 구축
- Deployment 생성으로 한 번의 커맨드로 AI 애플리케이션을 프로덕션에 배포
- Concurrency와 autoscaling 설정으로 최적 성능 달성
- GPU 추론 지원으로 GPU에서 모델 추론 실행
- 모델 로딩·관리로 커스텀 모델을 로드하고 서빙