Llama 4 Maverick — 17Bx128E 멀티모달 모델

Llama 4 Maverick — 17Bx128E 멀티모달 모델

Llama 4 Maverick은 17B 활성 파라미터, 128개 전문가를 가진 MoE 멀티모달 모델이에요. 총 파라미터는 400B로, 전체는 메모리에 저장하지만 추론 시엔 17B만 활성화돼요. 1M 토큰 컨텍스트를 지원해요.

출처: meta-llama/Llama-4-Maverick-17B-128E-Instruct

주요 스펙

항목
활성 파라미터 17B
총 파라미터 400B
전문가 128 Expert (MoE)
입력 모달리티 다국어 텍스트 + 이미지
출력 모달리티 다국어 텍스트 + 코드
컨텍스트 길이 1M
토큰 수(훈련) ~22T
지식 컷오프 2024년 8월

transformers로 쓰기

from transformers import AutoProcessor, Llama4ForConditionalGeneration
import torch

model_id = "meta-llama/Llama-4-Maverick-17B-128E-Instruct"
processor = AutoProcessor.from_pretrained(model_id)
model = Llama4ForConditionalGeneration.from_pretrained(model_id, ...)

벤치마크 (Instruction-tuned)

  • MMLU Pro: 80.5, LiveCodeBench: 43.4, MMMU: 73.4, MathVista: 73.7
  • DOCVQA(test): 94.4, MGSM: 92.3

라이선스·양자화

Llama 4 Community License로 배포되고, Maverick은 BF16과 FP8 양자화 가중치를 모두 제공해요. FP8 가중치는 단일 H100 DGX 호스트에 들어가면서도 품질을 유지해요.

더 알아보기