Nemotron-4-340B-Instruct — 모델 카드

Nemotron-4-340B-Instruct — 모델 카드

Nemotron-4-340B-Instruct는 Nemotron-4-340B-Base를 파인튜닝한 340B 대형 언어 모델이에요. 영어 기반 단일·다중 턴 채팅에 최적화되어 있고, 컨텍스트 길이는 4,096 토큰이에요.

출처: nvidia/Nemotron-4-340B-Instruct

사전훈련·정렬

Base 모델은 9T 토큰의 영어 중심 텍스트, 50+ 자연어, 40+ 코딩 언어로 사전훈련됐어요. 이후 다음 과정으로 정렬했어요.

  • Supervised Fine-tuning (SFT)
  • Direct Preference Optimization (DPO)
  • Reward-aware Preference Optimization (RPO) — 엔비디아 내부 정렬 기법

인간 주석 데이터는 약 2만 개만 쓰고, 나머지 98% 이상은 합성 데이터 파이프라인으로 만들었다는 게 특징이에요.

아키텍처·하드웨어

  • 표준 디코더-온리 Transformer, 4096 토큰 시퀀스, GQA(Grouped-Query Attention), RoPE 사용
  • BF16 추론: 8x H200(1노드), 16x H100(2노드), 16x A100 80GB(2노드)

프롬프트 포맷

시스템 프롬프트는 비워두는 것을 권장해요.

<extra_id_0>System

<extra_id_1>User
{prompt}
<extra_id_1>Assistant

성능

  • MT-Bench: 8.22, MMLU 0-shot: 78.7, GSM8K 0-shot: 92.3, HumanEval 0-shot: 73.2, MBPP 0-shot: 75.4, IFEval: 79.9, Arena Hard: 54.2

더 알아보기