Granite 3.0 개요 — 제품군과 사전훈련

Granite 3.0 개요 — 제품군과 사전훈련

Granite 3.0은 IBM이 만든 경량 오픈 파운데이션 모델 시리즈예요. 다국어·코딩·추론·도구 사용을 기본 지원하고, 제한된 컴퓨팅 자원에서도 돌릴 수 있다는 게 특징이에요. 모든 모델은 Apache 2.0 라이선스로 연구·상업 양쪽에 공개됐어요.

출처: ibm-granite/granite-3.0-language-models

네 가지 크기

  • Dense 모델: 2B·8B — 총 12T 토큰으로 훈련
  • MoE 모델: 1B·3B (활성 400M·800M) — 총 10T 토큰으로 훈련

각 크기마다 사전훈련(base) 체크포인트와 대화·명령 따르기·도움·안전용 지시 튜닝(instruct) 체크포인트를 모두 제공해요.

데이터 수집·거버넌스

훈련 데이터는 IBM이 큐레이션한 웹의 자연어·코드 텍스트, 합성 데이터셋, 권한 있는 공개 고품질 데이터셋을 섞어 구성했어요. 모든 데이터는 거버넌스·위험·규정 준수(GRC) 기준과 IBM의 데이터 클리어런스 절차, 문서 품질 검사를 통과했어요. 코드 파일은 GitHub API로 라이선스 정보를 주석 처리해 퍼미시브 라이선스 파일만 훈련에 썼어요.

사전훈련

토큰화는 StarCoder와 같은 BPE 토크나이저를 사용했어요. 2단계 데이터 혼합(MiniCPM·JetMoE 방식), 소규모 하이퍼파라미터 검색의 0-shot 전이, Tensor·Pipeline·Data 3D 병렬화로 훈련했어요.

더 알아보기