Jamba 배포 — vLLM으로 자체 환경에 띄우기

Jamba 배포 — vLLM으로 자체 환경에 띄우기

Jamba는 자체 API 없이도 vLLM이라는 오픈소스 고성능 LLM 추론·서빙 라이브러리로 직접 배포할 수 있어요. 데이터를 회사 안에 두고 싶은 환경에 유용합니다.

출처: https://docs.ai21.com/docs/vllm

vLLM이란

vLLM은 높은 처리량(throughput)의 LLM 추론과 서빙을 위한 오픈소스 라이브러리예요. PagedAttention·continuous batching 같은 최적화로 GPU 활용을 극대화합니다.

데모 서빙 흐름

vLLM의 데모 스크립트로 Jamba를 오픈AI 호환 서버로 띄우는 전형적인 흐름이에요.

python -m vllm.entrypoints.openai.api_server     --model ai21labs/AI21-Jamba-1.5-Large     --max-model-len 4096

모델 ID는 사용하는 Jamba 체크포인트 이름으로 바꾸면 되고, 문맥 길이는 --max-model-len으로 조절합니다.

배포 전 확인할 것

  • 사용하는 Jamba 버전에 맞는 vLLM 버전 호환성을 문서에서 확인해요.
  • Mamba 커널 사용 여부(use_mamba_kernels)와 GPU 메모리 요건을 점검해야 해요.
  • 클라우드 관리형 배포가 필요하다면 Cloud Platform Deployment 가이드를, 문제가 생기면 Troubleshooting & Performance Optimization 문서를 참고하세요.

더 알아보기

  • https://docs.ai21.com/docs/vllm — vLLM 배포 가이드
  • https://docs.ai21.com/docs/cloud-platform-deployment — 관리형 클라우드 배포