HF Mistral 모델 문서 — GQA 도입 모델
HF Mistral 모델 문서 — GQA 도입 모델
Mistral 모델은 그룹-쿼리 어텐션(GQA) 과 슬라이딩 윈도우 어텐션(SWA)을 결합해 효율적인 추론을 추구한 아키텍처예요. 7B에서 8k 컨텍스트를 지원하며, GQA로 KV 캐시를 효율 관리해요.
특징
- 8k 토큰 컨텍스트를 지원해 긴 문맥을 처리해요.
- GQA 를 사용해 KV 캐시 메모리를 줄이고 추론 지연을 낮춰요.
- 슬라이딩 윈도우 어텐션으로 큰 윈도우에서 계산 비용을 아껴요.
from transformers import MistralForCausalLM
model = MistralForCausalLM.from_pretrained("mistralai/Mistral-7B-v0.1")
사용 팁
- Mistral의
num_key_value_heads가 쿼리 헤드보다 작아 GQA 동작을 확인할 수 있어요. - 긴 문서 처리에서 GQA + 슬라이딩 윈도우 조합이 메모리 효율을 높여요.