KV Cache Quantization — 키-값 캐시를 FP8로 압축해 더 많은 토큰을
KV Cache Quantization
생성 시 매 토큰마다 이전 어텐션의 키(K)·값(V)이 쌓이는 KV 캐시는 메모리의 큰 부분을 차지해요. KV Cache Quantization(KV 캐시 양자화) 은 이 캐시를 FP8 같은 낮은 정밀도로 바꿔 메모리를 줄이고, 더 긴 컨텍스트·더 높은 스루풋을 가능하게 해요. vLLM과 Hugging Face Transformers가 대표적이에요.
이 카테고리의 문서
- 개요: vLLM — FP8 KV 캐시 양자화
- 핵심 기능: Transformers — Cache 클래스와 캐시 전략
- 실전·API: vLLM 양자화 — 자동 보정(calibration) 예제
출처: https://docs.vllm.ai/en/stable/features/quantization/quantized_kvcache/