LangChain

LangChain

vLLM은 LangChain을 통해서도 사용할 수 있습니다. LangChain의 VLLM 클래스를 사용하면 단일 GPU 또는 멀티 GPU에서 vLLM 기반 추론을 쉽게 실행할 수 있습니다.

출처: 문서

본문

vLLM은 LangChain을 통해서도 사용할 수 있습니다.

LangChain을 설치하려면 다음을 실행하세요:

pip install langchain langchain_community -q

단일 또는 멀티 GPU에서 추론을 실행하려면 langchainVLLM 클래스를 사용하세요.

from langchain_community.llms import VLLM

llm = VLLM(
    model="Qwen/Qwen3-4B",
    trust_remote_code=True,  # mandatory for hf models
    max_new_tokens=128,
    top_k=10,
    top_p=0.95,
    temperature=0.8,
    # for distributed inference
    # tensor_parallel_size=...,
)

print(llm("What is the capital of France ?"))

핵심 포인트

  • VLLM 클래스는 vLLM의 LLM 추론 엔진을 감싼 LangChain 래퍼입니다. model에는 vLLM이 서빙하는 모델 이름(Hugging Face 레포지토리 ID 또는 로컬 경로)을 넣습니다.
  • trust_remote_code=True는 HF 모델에서 필수입니다. 커스텀 아키텍처의 모델 코드를 원격에서 불러올 수 있게 합니다.
  • tensor_parallel_size를 지정하면 멀티 GPU 분산 추론이 활성화되고, 모델이 단일 GPU에 들어가지 않을 때 반드시 필요합니다. 값은 GPU 수와 일치해야 합니다.
  • 그 밖의 추론 파라미터(max_new_tokens, top_k, top_p, temperature)는 vLLM의 샘플링 설정과 일대일로 대응합니다.
  • llm(...)을 호출하면 프롬프트에 대한 생성 결과를 반환합니다. 배치 입력(문자열 리스트)도 지원합니다.

자세한 내용은 이 Tutorial을 참고하세요.

더 알아보기 (Learn more)