vLLM 예제
vLLM 예제 (Examples)
vLLM의 예제는 용도별 카테고리로 정리되어 있습니다. 각 카테고리는 오프라인 추론, 온라인 서빙, 임베딩, 추론(reasoning), 툴 호출, 배포, disaggregated 추론 등 특정 목적에 맞는 최소한의 실행 코드를 담고 있습니다.
출처: 문서
본문
vLLM의 예제는 다음 카테고리로 구성됩니다.
- basic/ – 오프라인 추론과 온라인 서빙을 위한 최소 예제.
- generate/ – 멀티모달 모델을 포함한 텍스트 생성 예제.
- pooling/ – 임베딩·분류·스코어링·보상(reward) 등을 위한 예제.
- speech_to_text/ – 음성 전사·번역·실시간 오디오 예제.
- features/ – 개별 vLLM 기능 데모: automatic prefix caching, speculative decoding, LoRA, structured outputs, prompt embedding, pause/resume, batch invariance, KV events, data parallelism 등.
- reasoning/ – vLLM으로 추론(reasoning)하는 예제.
- tool_calling/ – vLLM으로 함수/툴 호출하는 예제.
- applications/ – 더 단순한 api server, 챗봇, RAG(Retrieval-Augmented Generation) 같은 애플리케이션 예제.
- rl/ – 강화학습 예제.
- deployment/ – vLLM을 프로덕션에 배포하는 예제.
- ray_serving/ – Ray를 이용한 확장 가능한 서빙.
- disaggregated/ – Disaggregated P/D(Prefill/Decoding) 추론 예제. 다양한 KV 캐시 커넥터(LMCache, Mooncake, FlexKV, P2P NCCL)와 장애 복구(failure recovery)를 포함.
- scale_out/ – Token In <> Token Out API 서버를 위한 예제.
- observability/ – 메트릭·로깅·트레이싱(OpenTelemetry)·대시보드(Grafana, Perses).