LlamaIndex
LlamaIndex
vLLM은 LlamaIndex를 통해서도 사용할 수 있습니다. LlamaIndex의 Vllm 클래스를 사용하면 단일 또는 멀티 GPU에서 vLLM 기반 추론을 쉽게 실행할 수 있습니다.
출처: 문서
본문
vLLM은 LlamaIndex를 통해서도 사용할 수 있습니다.
LlamaIndex를 설치하려면 다음을 실행하세요:
pip install llama-index-llms-vllm -q
단일 또는 멀티 GPU에서 추론을 실행하려면 llamaindex의 Vllm 클래스를 사용하세요.
from llama_index.llms.vllm import Vllm
llm = Vllm(
model="microsoft/Orca-2-7b",
tensor_parallel_size=4,
max_new_tokens=100,
vllm_kwargs={"gpu_memory_utilization": 0.5},
)
핵심 포인트
Vllm클래스는 vLLM의LLM추론 엔진을 감싼 LlamaIndex LLM 래퍼입니다.model에는 vLLM이 서빙하는 모델 이름(Hugging Face 레포지토리 ID)을 넣습니다.tensor_parallel_size를 지정하면 멀티 GPU 분산 추론이 활성화됩니다. 값은 사용할 GPU 수와 일치해야 합니다.vllm_kwargs를 통해gpu_memory_utilization같은 추가 vLLM 엔진 옵션을 넘길 수 있습니다. KV cache를 위해 예약할 GPU 메모리 비율을 조정합니다.max_new_tokens는 생성할 최대 토큰 수를 제한합니다.- 생성된
llm인스턴스는 LlamaIndex의 다른 LLM처럼 채팅·완성 인터페이스로 사용할 수 있으며, RAG 파이프라인에 자연스럽게 연결됩니다.
자세한 내용은 이 Tutorial을 참고하세요.
더 알아보기 (Learn more)
- LangChain 연동 — LangChain에 vLLM 연결
- LlamaIndex vLLM 튜토리얼 — LlamaIndex에서 vLLM 사용
- 오프라인 추론 — vLLM 오프라인 추론