GQA 논문 — Grouped-Query Attention 제안

GQA 논문 — Grouped-Query Attention 제안

GQA(Grouped-Query Attention) 논문은 쿼리 헤드를 여러 개 두되 키·밸류 헤드를 그룹으로 공유하는 어텐션을 제안해요. 멀티-헤드(MHA)의 표현력과 멀티-쿼리(MQA)의 메모리 효율 사이의 절충점을 잡아요.

배경

  • MHA(Multi-Head): 쿼리뿐 아니라 키·밸류도 헤드마다 따로 두어 표현력은 좋지만 KV 캐시 메모리가 큼.
  • MQA(Multi-Query): 모든 쿼리 헤드가 하나의 키·밸류를 공유해 메모리·속도는 좋지만 성능 저하.
  • GQA: 쿼리 헤드를 G개의 그룹으로 나누고, 그룹마다 키·밸류 헤드 하나를 공유.

결과

  • KV 캐시 메모리를 MHA대비 상당히 줄이면서 MHA 대비 성능 저하가 작아요.
  • 추론 처리량과 메모리 사용에서 큰 이득을 얻어 LLM 서빙 시 유리해요.
  • 쿼리·키·밸류 헤드 수를 num_key_value_heads 등으로 명시해요.

더 알아보기