Xinference 설치 — 백엔드별 옵션
Xinference 설치
Xinference 는 pip 로 Linux, Windows, macOS 에 설치할 수 있습니다. 서빙할 모델 종류에 맞는 백엔드를 함께 설치합니다.
전체 설치
모든 모델을 서빙하려면 의존성을 한 번에 설치합니다.
pip install "xinference[all]"
vLLM 과 sglang 은 의존성 충돌이 있어 v1.8.1 부터 sglang 을 all extra 에서 제외했습니다. sglang 은
pip install "xinference[sglang]"로 따로 설치하세요.
transformers 백엔드
대부분의 최신 모델 추론을 지원하며 기본값입니다. pytorch/gptq/awq/bnb/fp4 형식을 지원합니다.
pip install "xinference[transformers]"
vLLM 백엔드
pytorch/gptq/awq/fp4/fp8/bnb 형식·Linux·CUDA 조건에서 더 나은 처리량을 위해 vLLM 을 선택합니다.
pip install "xinference[vllm]"
llama.cpp 백엔드 (xllamacpp)
GGUF 형식을 지원하며, v1.6.0 부터 Xinference 팀의 xllamacpp 가 유일한 llama.cpp 백엔드입니다.
pip install "xinference[llama_cpp]"
SGLang 백엔드
RadixAttention 으로 KV 캐시 재사용 등 고성능 추론을 제공합니다. pip install "xinference[sglang]".
MLX 백엔드
Apple silicon 에서 효율적으로 LLM 을 실행하는 데 씁니다. pip install "xinference[mlx]".