Granite-3.0-8B-Instruct — 모델 카드

Granite-3.0-8B-Instruct — 모델 카드

Granite-3.0-8B-Instruct는 Granite-3.0-8B-Base를 공개 지시 데이터셋과 내부 합성 데이터셋으로 파인튜닝한 8B 모델이에요. 구조화된 채팅 포맷, 지도 파인튜닝, 강화학습 정렬, 모델 병합 등의 기법으로 만들었어요.

출처: ibm-granite/granite-3.0-8b-instruct

모델 스펙

  • 파라미터: 8.1B, 활성 8.1B, 훈련 토큰 12T
  • 아키텍처: decoder-only dense transformer (GQA + RoPE, SwiGLU MLP, RMSNorm, 공유 입·출력 임베딩)
  • 출시일: 2024년 10월 21일, 라이선스 Apache 2.0
  • 지원 언어: 영어·독일어·스페인어·프랑스어·일본어·포르투갈어·아랍어·체코어·이탈리아어·한국어·네덜란드어·중국어 (12개)

아키텍처 상세 (8B Dense)

  • 임베딩 크기 4096, 레이어 40, 어텐션 헤드 32, KV 헤드 8, MLP hidden 12800

능력

요약, 텍스트 분류, 텍스트 추출, 질문 답변, RAG(Retrieval Augmented Generation), 코드 관련 태스크, 함수 호출, 다국어 대화까지 폭넓게 지원해요.

사용 예시

from transformers import AutoModelForCausalLM

model = AutoModelForCausalLM.from_pretrained("ibm-granite/granite-3.0-8b-instruct", device_map="auto")

messages = [
    {"role": "user", "content": "Who are you?"},
]

더 알아보기