기능
기능 (Features)
vLLM이 지원하는 다양한 기능(sampling, 추론 최적화, 멀티모달 등)이 서로 어떤 조합으로 동작하는지, 그리고 하드웨어별로 어디까지 지원되는지를 한눈에 보여주는 호환성 매트릭스 문서입니다. 이 표를 먼저 보면 "내가 쓰려는 기능 조합이 실제로 가능한가"를 빠르게 확인할 수 있습니다.
출처: 문서
본문
호환성 매트릭스 (Compatibility Matrix)
아래 표들은 서로 배타적(mutually exclusive)인 기능 조합과, 일부 하드웨어에서의 지원 여부를 보여줍니다.
표에 쓰인 기호의 의미는 다음과 같습니다.
- ✅ = 완전 호환 (Full compatibility)
- 🟠 = 부분 호환 (Partial compatibility)
- ❌ = 호환 없음 (No compatibility)
- ❔ = 알 수 없음 또는 미정 (Unknown or TBD)
참고: ❌나 🟠 표시에 링크가 걸려 있다면, 지원되지 않는 기능/하드웨어 조합의 추적 이슈(tracking issue)를 확인할 수 있는 링크입니다.
기능 x 기능 (Feature x Feature)
td:not(:first-child) { text-align: center !important; } td { padding: 0.5rem !important; white-space: nowrap; } th { padding: 0.5rem !important; min-width: 0 !important; } th:not(:first-child) { writing-mode: vertical-lr; transform: rotate(180deg) }
| Feature | CP | APC | LoRA | SD | CUDA graph | pooling | enc-dec | logP | prmpt logP | async output | multi-step | mm | best-of | beam-search | prompt-embeds | | CP | ✅ | | | | | | | | | | | | | | | | APC | ✅ | ✅ | | | | | | | | | | | | | | | LoRA | ✅ | ✅ | ✅ | | | | | | | | | | | | | | SD | ✅ | ✅ | ❌ | ✅ | | | | | | | | | | | | | CUDA graph | ✅ | ✅ | ✅ | ✅ | ✅ | | | | | | | | | | | | pooling | 🟠* | 🟠* | ✅ | ❌ | ✅ | ✅ | | | | | | | | | | | enc-dec | ❌ | ❌ | ❌ | ❌ | ✅ | ✅ | ✅ | | | | | | | | | | logP | ✅ | ✅ | ✅ | ✅ | ✅ | ❌ | ✅ | ✅ | | | | | | | | | prmpt logP | ✅ | ✅ | ✅ | ✅ | ✅ | ❌ | ✅ | ✅ | ✅ | | | | | | | | async output | ✅ | ✅ | ✅ | ❌ | ✅ | ❌ | ❌ | ✅ | ✅ | ✅ | | | | | | | multi-step | ❌ | ✅ | ❌ | ❌ | ✅ | ❌ | ❌ | ✅ | ✅ | ✅ | ✅ | | | | | | mm | ✅ | ✅ | 🟠 ^ | ❔ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ❔ | ✅ | | | | | best-of | ✅ | ✅ | ✅ | ❌ | ✅ | ❌ | ✅ | ✅ | ✅ | ❔ | ❌ | ✅ | ✅ | | | | beam-search | ✅ | ✅ | ✅ | ❌ | ✅ | ❌ | ✅ | ✅ | ✅ | ❔ | ❌ | ❔ | ✅ | ✅ | | | prompt-embeds | ✅ | ✅ | ✅ | ❌ | ✅ | ❌ | ❌ | ✅ | ❌ | ❔ | ❔ | ✅ | ❔ | ❔ | ✅ |
- Chunked prefill과 prefix caching은 인과적 어텐션(causal attention)을 쓰는 last-token 또는 all pooling에서만 사용할 수 있습니다. ^ LoRA는 멀티모달 모델의 언어 백본(language backbone)에만 적용할 수 있습니다.
기능 x 하드웨어 (Feature x Hardware)
| Feature | Volta | Turing | Ampere | Ada | Hopper | CPU | AMD | Intel GPU | | CP | ❌ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | | APC | ❌ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | | LoRA | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | | SD | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | | CUDA graph | ✅ | ✅ | ✅ | ✅ | ✅ | ❌ | ✅ | ❌ | | pooling | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | | enc-dec | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ❌ | ✅ | | mm | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | | prompt-embeds | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ❔ | ✅ | | logP | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | | prmpt logP | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | | async output | ✅ | ✅ | ✅ | ✅ | ✅ | ❌ | ❌ | ✅ | | multi-step | ✅ | ✅ | ✅ | ✅ | ✅ | ❌ | ✅ | ✅ | | best-of | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | | beam-search | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
참고: Google TPU에서의 기능 지원에 대한 정보는 TPU-Inference Recommended Models and Features 문서를 참고하세요.
더 알아보기 (Learn more)
- TPU-Inference Recommended Models and Features — Google TPU에서 추천되는 모델과 지원 기능 목록