Llama 4 Maverick — 17Bx128E 멀티모달 모델
Llama 4 Maverick — 17Bx128E 멀티모달 모델
Llama 4 Maverick은 17B 활성 파라미터, 128개 전문가를 가진 MoE 멀티모달 모델이에요. 총 파라미터는 400B로, 전체는 메모리에 저장하지만 추론 시엔 17B만 활성화돼요. 1M 토큰 컨텍스트를 지원해요.
주요 스펙
| 항목 | 값 |
|---|---|
| 활성 파라미터 | 17B |
| 총 파라미터 | 400B |
| 전문가 | 128 Expert (MoE) |
| 입력 모달리티 | 다국어 텍스트 + 이미지 |
| 출력 모달리티 | 다국어 텍스트 + 코드 |
| 컨텍스트 길이 | 1M |
| 토큰 수(훈련) | ~22T |
| 지식 컷오프 | 2024년 8월 |
transformers로 쓰기
from transformers import AutoProcessor, Llama4ForConditionalGeneration
import torch
model_id = "meta-llama/Llama-4-Maverick-17B-128E-Instruct"
processor = AutoProcessor.from_pretrained(model_id)
model = Llama4ForConditionalGeneration.from_pretrained(model_id, ...)
벤치마크 (Instruction-tuned)
- MMLU Pro: 80.5, LiveCodeBench: 43.4, MMMU: 73.4, MathVista: 73.7
- DOCVQA(test): 94.4, MGSM: 92.3
라이선스·양자화
Llama 4 Community License로 배포되고, Maverick은 BF16과 FP8 양자화 가중치를 모두 제공해요. FP8 가중치는 단일 H100 DGX 호스트에 들어가면서도 품질을 유지해요.