Xinference — 오픈소스 AI 모델 서빙 플랫폼

Xinference(Xorbits Inference) 는 다양한 AI 모델의 운영·통합을 간소화하는 오픈소스 플랫폼입니다. 오픈소스 LLM·임베딩·리랭크·멀티모달 모델을 클라우드든 자체 인프라든 단일 명령으로 서빙하고, OpenAI 호환 API 를 기본 제공해 기존 클라이언트를 그대로 쓸 수 있습니다. vLLM·SGLang·llama.cpp·transformers·MLX 같은 추론 엔진을 선택해 성능과 리소스를 조절하며, 분산(supervisor/worker) 배포와 Docker 도 지원합니다.