KV Cache — 추론 시 키·밸류와 페이지드 메모리

KV Cache

디코딩은 토큰을 하나씩 생성하는데, 매 스텝 이전 토큰들의 키·밸류(KV)를 다시 계산하면 비효율적이에요. KV Cache는 이전 키·밸류를 재사용해 속도를 높이는 메모리 구조예요. vLLM은 이를 PagedAttention으로 블록 단위로 잘게 나눠 단편화를 극적으로 줄이고, 공통 접두사를 재사용하는 prefix caching도 지원해요.

이 카테고리의 문서

  • 핵심 기능: Paged Attention — KV 캐시를 블록으로 관리
  • 실전·API: Automatic Prefix Caching — 공통 접두사 재사용
  • 설정: CacheConfig — KV 캐시 메모리 설정

출처: https://docs.vllm.ai/en/latest/design/paged_attention/