GQA 논문 — Grouped-Query Attention 제안
GQA 논문 — Grouped-Query Attention 제안
GQA(Grouped-Query Attention) 논문은 쿼리 헤드를 여러 개 두되 키·밸류 헤드를 그룹으로 공유하는 어텐션을 제안해요. 멀티-헤드(MHA)의 표현력과 멀티-쿼리(MQA)의 메모리 효율 사이의 절충점을 잡아요.
배경
- MHA(Multi-Head): 쿼리뿐 아니라 키·밸류도 헤드마다 따로 두어 표현력은 좋지만 KV 캐시 메모리가 큼.
- MQA(Multi-Query): 모든 쿼리 헤드가 하나의 키·밸류를 공유해 메모리·속도는 좋지만 성능 저하.
- GQA: 쿼리 헤드를
G개의 그룹으로 나누고, 그룹마다 키·밸류 헤드 하나를 공유.
결과
- KV 캐시 메모리를 MHA대비 상당히 줄이면서 MHA 대비 성능 저하가 작아요.
- 추론 처리량과 메모리 사용에서 큰 이득을 얻어 LLM 서빙 시 유리해요.
- 쿼리·키·밸류 헤드 수를
num_key_value_heads등으로 명시해요.