PagedAttention — KV 캐시를 페이지로 나눠 메모리 파편화를 막다
PagedAttention
LLM 추론에서 어텐션의 키·값(KV) 캐시는 컨텍스트가 길어질수록 메모리의 상당 부분을 차지하고, 성장하는 방식이 비효율적이어요. PagedAttention 은 운영체제의 가상 메모리·페이징 기법을 KV 캐시에 적용해, 캐시를 고정 크기 블록(페이지)으로 나눠 메모리 파편화를 줄이고 공유를 가능하게 해요. vLLM의 핵심 기술이에요.
이 카테고리의 문서
- 개요: PagedAttention 논문 — 어텐션 메모리 관리
- 핵심 기능: vLLM 시스템 논문 — PagedAttention을 품은 서빙 엔진
- 실전·API: vLLM GitHub — 프로덕션 LLM 서빙 구현