vLLM 기능 목록
vLLM 기능 목록 (Features)
vLLM에는 성능을 높이거나, 특정 하드웨어에 맞추거나, 기능을 확장하기 위한 다양한 기능(features) 이 마련되어 있어요. 이 페이지는 vLLM의 각 기능이 서로 함께 쓸 수 있는지, 그리고 어떤 하드웨어에서 지원되는지 한눈에 파악할 수 있게 도와주는 호환성 매트릭스(Compatibility Matrix) 를 제공합니다.
호환성 매트릭스 (Compatibility Matrix)
아래 표들은 상호 배타적(mutually exclusive)인 기능들과, 특정 하드웨어에서의 지원 여부를 보여줘요. 사용되는 기호의 의미는 다음과 같아요.
| 기호 | 의미 |
|---|---|
| ✅ | 완전 호환 (Full compatibility) |
| 🟠 | 부분 호환 (Partial compatibility) |
| ❌ | 호환 불가 (No compatibility) |
| ❔ | 알 수 없음 / 추후 결정 (Unknown or TBD) |
기능 × 기능 (Feature x Feature)
이 표는 두 기능을 동시에 사용할 수 있는지를 보여줘요. 예를 들어 청크드 프리필(CP)과 자동 접두사 캐싱(APC)을 함께 쓸 수 있는지, LoRA나 추측 디코딩(SD)과는 조합이 가능한지 확인할 수 있죠.
| Feature | CP | APC | LoRA | SD | CUDA graph | pooling | enc-dec | logP | prompt logP | async output | multi-step | mm | best-of/beam-search | prompt-embeds |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| CP (Chunked Prefill) | ✅ | |||||||||||||
| APC | ✅ | ✅ |
표가 이어질수록 조합이 가능한(✅) 칸이 늘어나요. 기능을 조합해서 쓰려는 계획이 있다면, 이 표를 먼저 확인하는 게 좋아요.
기능 × 하드웨어 (Feature x Hardware)
이 표는 각 기능이 어떤 하드웨어에서 지원되는지를 보여줘요. 하드웨어 목록에는 Volta, Turing, Ampere, Ada, Hopper 같은 NVIDIA GPU 세대와 CPU, AMD, Intel GPU가 포함돼 있어요.
| Feature | Volta | Turing | Ampere | Ada | Hopper | CPU | AMD | Intel GPU |
|---|---|---|---|---|---|---|---|---|
| CP (Chunked Prefill) | ❌ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| async output | ✅ | ✅ | ✅ | ✅ | ✅ | ❌ | ❌ | ✅ |
예를 들어 구형 Volta GPU에서는 청크드 프리필(CP)이 지원되지 않는 걸 알 수 있어요. 배포 대상 하드웨어를 정할 때 이런 제약을 미리 파악하면 나중에 낭패 볼 일이 없답니다.
기능 목록
vLLM이 제공하는 대표적인 기능들은 다음과 같아요. 각각의 자세한 설명은 해당 문서 링크를 따라가면 됩니다.
- 자동 접두사 캐싱 (Automatic Prefix Caching)
- 컨텍스트 확장 (Context Extension)
- LoRA 어댑터
- 양자화 (Quantization)
- 멀티모달 입력 (Multimodal Inputs)
- KV 오프로딩 (KV Offloading)