Llama Stack — vLLM 통합

Llama Stack — vLLM 통합

vLLM은 Llama Stack을 통해서도 사용할 수 있습니다.

Llama Stack을 설치하려면 다음을 실행합니다:

pip install llama-stack -q

출처: 문서

본문

OpenAI 호환 API로 추론 (Inference using OpenAI-Compatible API)

그런 다음 Llama Stack 서버를 시작하고 다음 설정으로 vLLM 서버를 가리키도록 구성합니다:

inference:
  - provider_id: vllm0
    provider_type: remote::vllm
    config:
      url: http://127.0.0.1:8000

이 원격 vLLM 프로바이더에 대한 자세한 내용은 이 가이드를 참고하세요.

임베디드 vLLM으로 추론 (Inference using Embedded vLLM)

인라인 프로바이더도 제공됩니다. 이 방식을 사용하는 구성 예시입니다:

inference:
  - provider_type: vllm
    config:
      model: Llama3.1-8B-Instruct
      tensor_parallel_size: 4
  • remote::vllm 프로바이더는 별도로 실행 중인 vLLM OpenAI 호환 서버를 가리키며 HTTP URL로 연결합니다.
  • 인라인 vllm 프로바이더는 Llama Stack 프로세스 안에서 vLLM을 직접 실행해 모델과 텐서 병렬 크기(tensor_parallel_size)를 구성합니다.

어떤 방식을 선택할까 (선택 가이드)

  • 이미 vLLM 서버를 운영 중이거나, 기존 추론 인프라(예: Kubernetes의 vLLM)가 있다면 remote::vllm 프로바이더가 적합합니다. Llama Stack은 그저 클라이언트로 연결되므로 서버 관리 부담이 없습니다.
  • 단일 호스트에서 Llama Stack 번들로 빠르게 시작하고 싶다면 인라인 vllm 프로바이더를 쓰면 한 프로세스 안에서 vLLM을 구동해 배포가 단순해집니다. 여러 GPU를 쓸 때는 tensor_parallel_size를 설정합니다.

두 방식 모두 OpenAI 호환 인터페이스를 통해 추론되므로, Llama Stack의 에이전트·툴·평가 기능을 vLLM 모델과 함께 사용할 수 있습니다.

더 알아보기 (Learn more)