BentoML

BentoML

BentoML은 어떤 모델이든 어떤 클라우드에서든 AI 시스템을 배포하고 확장하기 위한 **통합 추론 플랫폼(Unified Inference Platform)**이에요. 오픈소스 모델 서빙 프레임워크로 출발해, 모델을 API 서비스로 만들고 컨테이너 이미지로 묶어 BentoCloud 같은 환경에 배포하는 전 과정을 다룬답니다.

핵심 개념

  • Bento: 소스 코드, Python 의존성, 모델 아티팩트, 설정을 한 덩어리로 묶은 표준 패키징 포맷
  • Service: @bentoml.service 데코레이터로 정의하는 온라인 API 서비스(모델 서빙 로직)
  • Model Store: 모델을 로컬에 저장·버전관리하는 모델 레지스트리
  • BentoCloud: BentoML의 관리형 클라우드 — 자동 스케일링, 옵저버빌리티, 보안 배포 지원

이 카테고리의 문서

  • 서빙: 온라인 API 서비스 만들기, 스트리밍 응답, 모델 로드와 관리
  • 배포: 배포용 패키징(Bento), BentoCloud 배포 개요
  • LLM 추론: BentoML과 vLLM로 OpenAI 호환 LLM 엔드포인트 서빙

출처: https://docs.bentoml.com