BentoML
BentoML
BentoML은 어떤 모델이든 어떤 클라우드에서든 AI 시스템을 배포하고 확장하기 위한 **통합 추론 플랫폼(Unified Inference Platform)**이에요. 오픈소스 모델 서빙 프레임워크로 출발해, 모델을 API 서비스로 만들고 컨테이너 이미지로 묶어 BentoCloud 같은 환경에 배포하는 전 과정을 다룬답니다.
핵심 개념
- Bento: 소스 코드, Python 의존성, 모델 아티팩트, 설정을 한 덩어리로 묶은 표준 패키징 포맷
- Service:
@bentoml.service데코레이터로 정의하는 온라인 API 서비스(모델 서빙 로직) - Model Store: 모델을 로컬에 저장·버전관리하는 모델 레지스트리
- BentoCloud: BentoML의 관리형 클라우드 — 자동 스케일링, 옵저버빌리티, 보안 배포 지원
이 카테고리의 문서
- 서빙: 온라인 API 서비스 만들기, 스트리밍 응답, 모델 로드와 관리
- 배포: 배포용 패키징(Bento), BentoCloud 배포 개요
- LLM 추론: BentoML과 vLLM로 OpenAI 호환 LLM 엔드포인트 서빙