Xinference 설치 — 백엔드별 옵션

Xinference 설치

Xinference 는 pip 로 Linux, Windows, macOS 에 설치할 수 있습니다. 서빙할 모델 종류에 맞는 백엔드를 함께 설치합니다.

출처: Installation — 공식문서

전체 설치

모든 모델을 서빙하려면 의존성을 한 번에 설치합니다.

pip install "xinference[all]"

vLLM 과 sglang 은 의존성 충돌이 있어 v1.8.1 부터 sglang 을 all extra 에서 제외했습니다. sglang 은 pip install "xinference[sglang]" 로 따로 설치하세요.

transformers 백엔드

대부분의 최신 모델 추론을 지원하며 기본값입니다. pytorch/gptq/awq/bnb/fp4 형식을 지원합니다.

pip install "xinference[transformers]"

vLLM 백엔드

pytorch/gptq/awq/fp4/fp8/bnb 형식·Linux·CUDA 조건에서 더 나은 처리량을 위해 vLLM 을 선택합니다.

pip install "xinference[vllm]"

llama.cpp 백엔드 (xllamacpp)

GGUF 형식을 지원하며, v1.6.0 부터 Xinference 팀의 xllamacpp 가 유일한 llama.cpp 백엔드입니다.

pip install "xinference[llama_cpp]"

SGLang 백엔드

RadixAttention 으로 KV 캐시 재사용 등 고성능 추론을 제공합니다. pip install "xinference[sglang]".

MLX 백엔드

Apple silicon 에서 효율적으로 LLM 을 실행하는 데 씁니다. pip install "xinference[mlx]".

더 알아보기