Mistral 7B 발표 — 성능과 어텐션 기법
Mistral 7B 발표 — 성능과 어텐션 기법
Mistral 7B는 출시 당시 **'그 크기에서 가장 강력한 언어 모델'**로 소개된 7.3B 모델이에요. 주요 성과는 이렇죠.
출처: Mistral 7B 발표
한눈에 보는 특징
- 7.3B 파라미터 모델
- 모든 벤치마크에서 Llama 2 13B 능가
- 여러 벤치마크에서 Llama 1 34B에 필적 (지식 벤치마크에서는 동등)
- 코드에서 CodeLlama 7B에 근접하면서 영어 태스크는 유지
- GQA(Grouped-Query Attention) 로 추론 가속
- SWA(Sliding Window Attention) 로 긴 시퀀스를 저비용으로 처리
- Apache 2.0 라이선스로 제약 없이 사용 가능
어텐션: Flash and Furious
Mistral 7B는 슬라이딩 윈도우 어텐션(SWA) 을 써요. 각 레이어가 이전 4,096개의 hidden state에만 어텐션을 하죠. 이 방식으로 시퀀스 길이 8192의 추론에서 캐시 메모리를 절반 아끼면서도 모델 품질엔 영향을 주지 않아요.
학습·적용
mistral-src 참조 구현으로 어디서든(로컬 포함) 다운로드해 쓸 수 있고, vLLM + skypilot으로 AWS/GCP/Azure에 배포할 수 있어요. 허깅페이스에서도 제공돼요.