Granite 4.0 — 하이브리드 Mamba-2/transformer 아키텍처
Granite 4.0
Granite 4.0은 하이브리드 Mamba-2/transformer 아키텍처와 Mixture-of-Experts(MoE)를 도입한 언어 모델 패밀리예요. 비슷한 모델 대비 메모리 사용을 70% 이상 줄이고, 특히 멀티 세션·장문 컨텍스트 시나리오에서 추론 속도를 2배 높인다고 해요.
모델 변형
| 모델 | 아키텍처 | 크기 | 용도 |
|---|---|---|---|
| Granite-4.0-H-Small | Hybrid, MoE | 32B total / 9B activated | RAG·에이전트 같은 핵심 기업 작업 |
| Granite-4.0-H-Tiny | Hybrid, MoE | 7B total / 1B activated | 저지연 로컬 앱 |
| Granite-4.0-H-Micro | Hybrid, Dense | 3B | 함수 호출 등 에이전트 워크플로 |
| Granite-4.0-Micro | Traditional, Dense | 3B | Mamba2 미최적화 환경용 대안 |
| Granite-4.0-H-1B | Dense, Hybrid | 1.5B | 엣지·온디바이스 |
라이선스·특징
Apache 2.0으로 배포되고, 암호화 서명되며, ISO 42001 인증을 받은 최초의 오픈 모델 패밀리예요. Granite 4.0 Small은 지시 따르기·함수 호출 같은 주요 에이전트 작업에서 업계 선두 성능을 보여줘요.
추론 예시
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
device = "cuda"
model_path = "ibm-granite/granite-4.0-h-tiny"
tokenizer = AutoTokenizer.from_pretrained(model_path)
model = AutoModelForCausalLM.from_pretrained(model_path, device_map=device)