Speculative Decoding — 작은 제안 모델로 추론 가속화
Speculative Decoding
토큰 하나씩 차례대로 생성하는 LLM 추론은 그 자체로 병목이 돼요. **추측 디코딩(speculative decoding)**은 작은(draft) 모델이 여러 후보 토큰을 먼저 만들어 내고, 큰(target) 모델이 이를 한 번에 검증하는 방식으로 평균 생성 지연을 줄이는 기법이에요. vLLM은 EAGLE·MTP·드래프트 모델·n-gram 등 다양한 방식을 지원해요.
이 카테고리의 문서
- 개요: vLLM의 추측 디코딩 방식 종류와 선택
- 핵심 기능: 설계 원리와 손실 없는 보장
- 실전·API: vLLM 설정으로 켜기 + HF assisted decoding
출처: https://vllm.readthedocs.io/en/latest/features/speculative_decoding.html