GQA — 쿼리는 많이, 키·밸류는 적게 나누는 어텐션

Grouped-Query Attention (GQA)

GQA(Grouped-Query Attention) 는 멀티-쿼리 어텐션(MQA)과 멀티-헤드 어텐션(MHA)의 중간 형태예요. 여러 쿼리 헤드가 하나의 키·밸류 헤드를 공유해, KV 캐시 메모리를 크게 줄이면서도 MHA에 가까운 성능을 유지해요. Llama·Mistral 같은 현대 LLM의 표준 어텐션 설계예요.

이 카테고리의 문서

  • 개요: GQA 논문 — GQA/MQA 제안과 성능
  • 핵심 기능: HF Llama 모델 문서 — GQA를 쓰는 대표 모델
  • 실전·API: HF Mistral 모델 문서 — GQA 도입 모델

출처: https://arxiv.org/abs/2305.13245