PagedAttention — KV 캐시를 페이지로 나눠 메모리 파편화를 막다

PagedAttention

LLM 추론에서 어텐션의 키·값(KV) 캐시는 컨텍스트가 길어질수록 메모리의 상당 부분을 차지하고, 성장하는 방식이 비효율적이어요. PagedAttention 은 운영체제의 가상 메모리·페이징 기법을 KV 캐시에 적용해, 캐시를 고정 크기 블록(페이지)으로 나눠 메모리 파편화를 줄이고 공유를 가능하게 해요. vLLM의 핵심 기술이에요.

이 카테고리의 문서

  • 개요: PagedAttention 논문 — 어텐션 메모리 관리
  • 핵심 기능: vLLM 시스템 논문 — PagedAttention을 품은 서빙 엔진
  • 실전·API: vLLM GitHub — 프로덕션 LLM 서빙 구현

출처: https://arxiv.org/abs/2309.06180