LlamaIndex

LlamaIndex

vLLM은 LlamaIndex를 통해서도 사용할 수 있습니다. LlamaIndex의 Vllm 클래스를 사용하면 단일 또는 멀티 GPU에서 vLLM 기반 추론을 쉽게 실행할 수 있습니다.

출처: 문서

본문

vLLM은 LlamaIndex를 통해서도 사용할 수 있습니다.

LlamaIndex를 설치하려면 다음을 실행하세요:

pip install llama-index-llms-vllm -q

단일 또는 멀티 GPU에서 추론을 실행하려면 llamaindexVllm 클래스를 사용하세요.

from llama_index.llms.vllm import Vllm

llm = Vllm(
    model="microsoft/Orca-2-7b",
    tensor_parallel_size=4,
    max_new_tokens=100,
    vllm_kwargs={"gpu_memory_utilization": 0.5},
)

핵심 포인트

  • Vllm 클래스는 vLLM의 LLM 추론 엔진을 감싼 LlamaIndex LLM 래퍼입니다. model에는 vLLM이 서빙하는 모델 이름(Hugging Face 레포지토리 ID)을 넣습니다.
  • tensor_parallel_size를 지정하면 멀티 GPU 분산 추론이 활성화됩니다. 값은 사용할 GPU 수와 일치해야 합니다.
  • vllm_kwargs를 통해 gpu_memory_utilization 같은 추가 vLLM 엔진 옵션을 넘길 수 있습니다. KV cache를 위해 예약할 GPU 메모리 비율을 조정합니다.
  • max_new_tokens는 생성할 최대 토큰 수를 제한합니다.
  • 생성된 llm 인스턴스는 LlamaIndex의 다른 LLM처럼 채팅·완성 인터페이스로 사용할 수 있으며, RAG 파이프라인에 자연스럽게 연결됩니다.

자세한 내용은 이 Tutorial을 참고하세요.

더 알아보기 (Learn more)