PagedAttention 논문 — 어텐션 메모리를 페이지 단위로 관리

PagedAttention 논문 — 어텐션 메모리를 페이지 단위로 관리

PagedAttention 은 LLM 서빙의 가장 큰 병목 중 하나인 KV 캐시 메모리 관리를 다룬다. 실제 LLM 서비스에서는 요청마다 길이가 달라서 KV 캐시가 지속적으로 커지는데, 기존 방식은 캐시를 연속된 메모리에 통째로 예약해 내부·외부 파편화로 메모리 최대 60~80%를 낭비했다.

핵심 아이디어

  • KV 캐시를 고정 크기의 블록(페이지) 으로 나누고, 연속적으로 배치하지 않는다.
  • 요청이 커지면 필요할 때마다 새 페이지를 할당하므로 정확히 필요한 만큼만 메모리를 쓴다.
  • 비연속 메모리 때문에 어텐션 커널이 페이지를 직접 다룰 수 있도록 block-level 어텐션 커널을 제공한다.
  • 같은 프롬프트를 공유하는 요청들은 페이지를 공유해 메모리(그리고 계산)까지 절약한다.

결과

PagedAttention은 그리디·샘플링 디코딩 모두에서 메모리 사용을 줄여, vLLM이 기존 시스템보다 2~4배 높은 처리량을 달성하게 했다. Llama-13B/S2 같은 모델과 다양한 서빙 워크로드에서 검증했다.

더 알아보기