HF Llama 모델 문서 — GQA를 쓰는 대표 모델

HF Llama 모델 문서 — GQA를 쓰는 대표 모델

Meta Llama 시리즈는 현대 LLM 어텐션 설계의 기준을 만든 모델이에요. Llama 2부터 GQA(Grouped-Query Attention) 를 도입해 추론 메모리와 속도를 개선했어요.

특징

  • RoPE 위치 임베딩과 그룹-쿼리 어텐션(GQA) 을 조합해 긴 컨텍스트를 효율 처리해요.
  • KV 캐시 메모리 절감으로 큰 모델·긴 컨텍스트 추론을 가능하게 해요.
  • config의 num_key_value_heads 로 키·밸류 헤드 수를 조절해요.
from transformers import LlamaConfig, LlamaForCausalLM
config = LlamaConfig(num_hidden_layers=16, num_attention_heads=16, num_key_value_heads=4)
model = LlamaForCausalLM(config)

사용 팁

  • num_key_value_heads < num_attention_heads 면 GQA, 같으면 MHA, 1이면 MQA예요.
  • 추론 시 KV 캐시 크기가 헤드 공유만큼 줄어 성능·메모리에 영향이 커요.

더 알아보기