LlamaIndex 통합

LlamaIndex 통합 (LlamaIndex)

LlamaIndex는 데이터 기반 LLM 애플리케이션(특히 RAG)을 만들기 위한 프레임워크예요. vLLM은 LlamaIndex를 통해서도 사용할 수 있어요. 이 페이지에서는 LlamaIndex에서 vLLM을 LLM으로 불러 쓰는 방법을 보여드릴게요.

출처: vLLM 공식 문서 — serving/integrations/llamaindex

vLLM은 LlamaIndex를 통해서도 사용할 수 있어요.

LlamaIndex를 설치하려면 다음을 실행하세요.

pip install llama-index-llms-vllm -q

단일 GPU 또는 여러 GPU에서 추론을 실행하려면 llamaindexVllm 클래스를 사용하세요.

from llama_index.llms.vllm import Vllm

llm = Vllm(
    model="microsoft/Orca-2-7b",
    tensor_parallel_size=4,
    max_new_tokens=100,
    vllm_kwargs={"gpu_memory_utilization": 0.5},
)

더 자세한 내용은 이 튜토리얼을 참고하세요.

더 알아보기 (Learn more)