Granite 4.0 — 하이브리드 Mamba-2/transformer 아키텍처

Granite 4.0

Granite 4.0은 하이브리드 Mamba-2/transformer 아키텍처와 Mixture-of-Experts(MoE)를 도입한 언어 모델 패밀리예요. 비슷한 모델 대비 메모리 사용을 70% 이상 줄이고, 특히 멀티 세션·장문 컨텍스트 시나리오에서 추론 속도를 2배 높인다고 해요.

출처: https://www.ibm.com/granite/docs/models/granite

모델 변형

모델 아키텍처 크기 용도
Granite-4.0-H-Small Hybrid, MoE 32B total / 9B activated RAG·에이전트 같은 핵심 기업 작업
Granite-4.0-H-Tiny Hybrid, MoE 7B total / 1B activated 저지연 로컬 앱
Granite-4.0-H-Micro Hybrid, Dense 3B 함수 호출 등 에이전트 워크플로
Granite-4.0-Micro Traditional, Dense 3B Mamba2 미최적화 환경용 대안
Granite-4.0-H-1B Dense, Hybrid 1.5B 엣지·온디바이스

라이선스·특징

Apache 2.0으로 배포되고, 암호화 서명되며, ISO 42001 인증을 받은 최초의 오픈 모델 패밀리예요. Granite 4.0 Small은 지시 따르기·함수 호출 같은 주요 에이전트 작업에서 업계 선두 성능을 보여줘요.

추론 예시

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

device = "cuda"
model_path = "ibm-granite/granite-4.0-h-tiny"
tokenizer = AutoTokenizer.from_pretrained(model_path)
model = AutoModelForCausalLM.from_pretrained(model_path, device_map=device)

더 알아보기