Mistral 7B 발표 — 성능과 어텐션 기법

Mistral 7B 발표 — 성능과 어텐션 기법

Mistral 7B는 출시 당시 **'그 크기에서 가장 강력한 언어 모델'**로 소개된 7.3B 모델이에요. 주요 성과는 이렇죠.

출처: Mistral 7B 발표

한눈에 보는 특징

  • 7.3B 파라미터 모델
  • 모든 벤치마크에서 Llama 2 13B 능가
  • 여러 벤치마크에서 Llama 1 34B에 필적 (지식 벤치마크에서는 동등)
  • 코드에서 CodeLlama 7B에 근접하면서 영어 태스크는 유지
  • GQA(Grouped-Query Attention) 로 추론 가속
  • SWA(Sliding Window Attention) 로 긴 시퀀스를 저비용으로 처리
  • Apache 2.0 라이선스로 제약 없이 사용 가능

어텐션: Flash and Furious

Mistral 7B는 슬라이딩 윈도우 어텐션(SWA) 을 써요. 각 레이어가 이전 4,096개의 hidden state에만 어텐션을 하죠. 이 방식으로 시퀀스 길이 8192의 추론에서 캐시 메모리를 절반 아끼면서도 모델 품질엔 영향을 주지 않아요.

학습·적용

mistral-src 참조 구현으로 어디서든(로컬 포함) 다운로드해 쓸 수 있고, vLLM + skypilot으로 AWS/GCP/Azure에 배포할 수 있어요. 허깅페이스에서도 제공돼요.

더 알아보기