LangChain
LangChain
vLLM은 LangChain을 통해서도 사용할 수 있습니다. LangChain의 VLLM 클래스를 사용하면 단일 GPU 또는 멀티 GPU에서 vLLM 기반 추론을 쉽게 실행할 수 있습니다.
출처: 문서
본문
vLLM은 LangChain을 통해서도 사용할 수 있습니다.
LangChain을 설치하려면 다음을 실행하세요:
pip install langchain langchain_community -q
단일 또는 멀티 GPU에서 추론을 실행하려면 langchain의 VLLM 클래스를 사용하세요.
from langchain_community.llms import VLLM
llm = VLLM(
model="Qwen/Qwen3-4B",
trust_remote_code=True, # mandatory for hf models
max_new_tokens=128,
top_k=10,
top_p=0.95,
temperature=0.8,
# for distributed inference
# tensor_parallel_size=...,
)
print(llm("What is the capital of France ?"))
핵심 포인트
VLLM클래스는 vLLM의LLM추론 엔진을 감싼 LangChain 래퍼입니다.model에는 vLLM이 서빙하는 모델 이름(Hugging Face 레포지토리 ID 또는 로컬 경로)을 넣습니다.trust_remote_code=True는 HF 모델에서 필수입니다. 커스텀 아키텍처의 모델 코드를 원격에서 불러올 수 있게 합니다.tensor_parallel_size를 지정하면 멀티 GPU 분산 추론이 활성화되고, 모델이 단일 GPU에 들어가지 않을 때 반드시 필요합니다. 값은 GPU 수와 일치해야 합니다.- 그 밖의 추론 파라미터(
max_new_tokens,top_k,top_p,temperature)는 vLLM의 샘플링 설정과 일대일로 대응합니다. llm(...)을 호출하면 프롬프트에 대한 생성 결과를 반환합니다. 배치 입력(문자열 리스트)도 지원합니다.
자세한 내용은 이 Tutorial을 참고하세요.
더 알아보기 (Learn more)
- LlamaIndex 연동 — LlamaIndex에 vLLM 연결
- LangChain vLLM 튜토리얼 — LangChain에서 vLLM 사용
- 오프라인 추론 — vLLM 오프라인 추론