Granite 코드 모델 오픈소스화 배경
Granite 코드 모델 오픈소스화 배경
IBM Research는 개발자 생산성 향상을 목표로 Granite 코드 모델 제품군을 오픈소스로 공개했어요. 코드 생성·수정·설명 같은 태스크를 처리하는 디코더-온리 코드 모델 시리즈이고, 116개 프로그래밍 언어의 코드로 훈련했어요. 모델 크기는 3B에서 34B까지, Base와 Instruct 변형 모두 제공해요.
출처: IBM Research 블로그
훈련 데이터
Base 모델은 3~4T 토큰(116개 언어) + 고품질 코드·자연어 혼합 데이터 500B 토큰으로 처음부터(from scratch) 훈련했어요. GitHub Code Clean, StarCoderData, 공개 코드 저장소·이슈, 그리고 코드 문제를 자연어로 설명한 CodeNet 메타데이터를 활용했어요. IBM의 AI 윤리 원칙과 법무팀 지침을 따라 수집한 데이터로 신뢰 가능한 엔터프라이즈 사용을 겨냥했어요.
34B 모델의 depth upscaling
34B 모델은 depth upscaling이라는 방법으로 훈련했어요. 20B 변형(52개 레이어)을 복제한 뒤, 하나에선 마지막 8개 레이어를, 다른 하나에선 처음 8개를 제거하고 두 버전을 병합해 88개 레이어의 새 모델을 만들었어요. 20B와 34B 모두 사전 훈련에 8,192 토큰 컨텍스트 창을 사용했어요.
성능
HumanEvalPack, HumanEvalPlus, RepoBench 벤치마크에서 코드 합성·수정·설명·편집·번역 전반에 걸쳐 강한 성능을 보여줘요. 일부 태스크에선 두 배 크기의 모델(Code Llama 등)을 능가하기도 해요.