vLLM 예제

vLLM 예제 (Examples)

vLLM의 예제는 용도별 카테고리로 정리되어 있습니다. 각 카테고리는 오프라인 추론, 온라인 서빙, 임베딩, 추론(reasoning), 툴 호출, 배포, disaggregated 추론 등 특정 목적에 맞는 최소한의 실행 코드를 담고 있습니다.

출처: 문서

본문

vLLM의 예제는 다음 카테고리로 구성됩니다.

  • basic/ – 오프라인 추론과 온라인 서빙을 위한 최소 예제.
  • generate/ – 멀티모달 모델을 포함한 텍스트 생성 예제.
  • pooling/ – 임베딩·분류·스코어링·보상(reward) 등을 위한 예제.
  • speech_to_text/ – 음성 전사·번역·실시간 오디오 예제.
  • features/ – 개별 vLLM 기능 데모: automatic prefix caching, speculative decoding, LoRA, structured outputs, prompt embedding, pause/resume, batch invariance, KV events, data parallelism 등.
  • reasoning/ – vLLM으로 추론(reasoning)하는 예제.
  • tool_calling/ – vLLM으로 함수/툴 호출하는 예제.
  • applications/ – 더 단순한 api server, 챗봇, RAG(Retrieval-Augmented Generation) 같은 애플리케이션 예제.
  • rl/ – 강화학습 예제.
  • deployment/ – vLLM을 프로덕션에 배포하는 예제.
  • ray_serving/ – Ray를 이용한 확장 가능한 서빙.
  • disaggregated/ – Disaggregated P/D(Prefill/Decoding) 추론 예제. 다양한 KV 캐시 커넥터(LMCache, Mooncake, FlexKV, P2P NCCL)와 장애 복구(failure recovery)를 포함.
  • scale_out/ – Token In <> Token Out API 서버를 위한 예제.
  • observability/ – 메트릭·로깅·트레이싱(OpenTelemetry)·대시보드(Grafana, Perses).

더 알아보기 (Learn more)