KV Cache Quantization — 키-값 캐시를 FP8로 압축해 더 많은 토큰을

KV Cache Quantization

생성 시 매 토큰마다 이전 어텐션의 키(K)·값(V)이 쌓이는 KV 캐시는 메모리의 큰 부분을 차지해요. KV Cache Quantization(KV 캐시 양자화) 은 이 캐시를 FP8 같은 낮은 정밀도로 바꿔 메모리를 줄이고, 더 긴 컨텍스트·더 높은 스루풋을 가능하게 해요. vLLM과 Hugging Face Transformers가 대표적이에요.

이 카테고리의 문서

  • 개요: vLLM — FP8 KV 캐시 양자화
  • 핵심 기능: Transformers — Cache 클래스와 캐시 전략
  • 실전·API: vLLM 양자화 — 자동 보정(calibration) 예제

출처: https://docs.vllm.ai/en/stable/features/quantization/quantized_kvcache/