HF Llama 모델 문서 — GQA를 쓰는 대표 모델
HF Llama 모델 문서 — GQA를 쓰는 대표 모델
Meta Llama 시리즈는 현대 LLM 어텐션 설계의 기준을 만든 모델이에요. Llama 2부터 GQA(Grouped-Query Attention) 를 도입해 추론 메모리와 속도를 개선했어요.
특징
- RoPE 위치 임베딩과 그룹-쿼리 어텐션(GQA) 을 조합해 긴 컨텍스트를 효율 처리해요.
- KV 캐시 메모리 절감으로 큰 모델·긴 컨텍스트 추론을 가능하게 해요.
- config의
num_key_value_heads로 키·밸류 헤드 수를 조절해요.
from transformers import LlamaConfig, LlamaForCausalLM
config = LlamaConfig(num_hidden_layers=16, num_attention_heads=16, num_key_value_heads=4)
model = LlamaForCausalLM(config)
사용 팁
num_key_value_heads < num_attention_heads면 GQA, 같으면 MHA, 1이면 MQA예요.- 추론 시 KV 캐시 크기가 헤드 공유만큼 줄어 성능·메모리에 영향이 커요.