Llama Stack — vLLM 통합
Llama Stack — vLLM 통합
vLLM은 Llama Stack을 통해서도 사용할 수 있습니다.
Llama Stack을 설치하려면 다음을 실행합니다:
pip install llama-stack -q
출처: 문서
본문
OpenAI 호환 API로 추론 (Inference using OpenAI-Compatible API)
그런 다음 Llama Stack 서버를 시작하고 다음 설정으로 vLLM 서버를 가리키도록 구성합니다:
inference:
- provider_id: vllm0
provider_type: remote::vllm
config:
url: http://127.0.0.1:8000
이 원격 vLLM 프로바이더에 대한 자세한 내용은 이 가이드를 참고하세요.
임베디드 vLLM으로 추론 (Inference using Embedded vLLM)
인라인 프로바이더도 제공됩니다. 이 방식을 사용하는 구성 예시입니다:
inference:
- provider_type: vllm
config:
model: Llama3.1-8B-Instruct
tensor_parallel_size: 4
- remote::vllm 프로바이더는 별도로 실행 중인 vLLM OpenAI 호환 서버를 가리키며 HTTP URL로 연결합니다.
- 인라인 vllm 프로바이더는 Llama Stack 프로세스 안에서 vLLM을 직접 실행해 모델과 텐서 병렬 크기(
tensor_parallel_size)를 구성합니다.
어떤 방식을 선택할까 (선택 가이드)
- 이미 vLLM 서버를 운영 중이거나, 기존 추론 인프라(예: Kubernetes의 vLLM)가 있다면
remote::vllm프로바이더가 적합합니다. Llama Stack은 그저 클라이언트로 연결되므로 서버 관리 부담이 없습니다. - 단일 호스트에서 Llama Stack 번들로 빠르게 시작하고 싶다면 인라인
vllm프로바이더를 쓰면 한 프로세스 안에서 vLLM을 구동해 배포가 단순해집니다. 여러 GPU를 쓸 때는tensor_parallel_size를 설정합니다.
두 방식 모두 OpenAI 호환 인터페이스를 통해 추론되므로, Llama Stack의 에이전트·툴·평가 기능을 vLLM 모델과 함께 사용할 수 있습니다.
더 알아보기 (Learn more)
- 모든 배포 통합 — vLLM과 연동되는 통합 목록
- Llama Stack 레포지토리
- 원격 vLLM 프로바이더 가이드