Llama 4 herd — Scout·Maverick·Behemoth

Llama 4 herd — Scout·Maverick·Behemoth

메타는 2025년 4월, Llama 4 '무리(herd)'의 첫 모델들을 공개했어요. 모두 네이티브 멀티모달을 지원하고 MoE 아키텍처를 처음으로 도입했죠. 이미지 이해와 텍스트 생성이 자연스럽게 어우러지는 게 핵심이에요.

출처: The Llama 4 herd

세 모델

  • Llama 4 Scout (17Bx16E): 17B 활성·16 전문가. 같은 급에서 최고의 멀티모달 모델이면서 10M 컨텍스트라는 업계 최고 수준의 컨텍스트 창을 제공해요. Int4 양자화로 단일 NVIDIA H100 GPU에 들어가요. Gemma 3, Gemini 2.0 Flash-Lite, Mistral 3.1보다 광범위한 벤치마크에서 더 나은 결과를 냈어요.
  • Llama 4 Maverick (17Bx128E): 17B 활성·128 전문가. GPT-4o와 Gemini 2.0 Flash를 여러 벤치마크에서 능가하고, 활성 파라미터가 절반 미만인 상태에서 DeepSeek v3에 필적하는 추론·코딩 성능을 보여줘요. LMArena에서 Elo 1417을 기록했어요.
  • Llama 4 Behemoth (288B 활성): 가장 강력한 교사(teacher) 모델로, 아직 훈련 중이에요. MATH-500·GPQA Diamond 같은 STEM 벤치마크에서 GPT-4.5, Claude Sonnet 3.7, Gemini 2.0 Pro를 능가한다고 해요.

기술 하이라이트

  • MetaP: 레이어별 학습률·초기화 스케일 같은 핵심 하이퍼파라미터를 안정적으로 설정하는 훈련 기법
  • 훈련 데이터: 30조+ 토큰 (Llama 3의 두 배 이상), 200개 언어 사전훈련
  • FP8 정밀도: Behemoth를 FP8로 훈련하며 GPU당 390 TFLOPs utilization 달성
  • 포스트트레이닝 파이프라인: 경량 SFT > 온라인 RL > 경량 DPO 순서로 재설계

더 알아보기