vAttention — PagedAttention 없는 LLM KV캐시 메모리 관리
vAttention — PagedAttention 없는 LLM KV캐시 메모리 관리
vAttention은 LLM 서빙에서 KV-캐시(KV-cache)의 메모리를 동적으로 관리하는 기법이에요. CUDA 가상 메모리 API로 가상 메모리와 물리 메모리 할당을 분리해서, 물리 메모리는 필요할 때만 할당하면서도 KV-캐시의 가상 메모리 연속성은 유지합니다.
기존의 PagedAttention이 페이지드 방식으로 주목받은 것과 달리, vAttention은 페이지드를 위한 커널 재작성 없이도 수정하지 않은 어텐션 커널에 동적 메모리 할당을 그대로 얹어주는 게 핵심이에요. 이 방식은 소프트웨어 복잡도를 줄이고 이식성을 높이며, 많은 경우(prefill 바운드 워크로드 특히) 성능도 개선합니다. 아래 페이지에서 배경, 접근 방식, 구현을 나눠 살펴볼게요.