Gemma 3 개요 — 개발자 가이드
Gemma 3 개요 — 개발자 가이드
Gemma 3는 Gemma 오픈 모델 패밀리의 가장 강력하고 진보된 버전이에요. 커뮤니티가 가장 원했던 기능인 긴 컨텍스트, 멀티모달을 추가했어요. 컨텍스트 창은 최대 128K 토큰, 140개 이상 언어, 개선된 수학·추론·채팅 능력(구조화 출력·함수 호출 포함)을 지원해요.
네 가지 크기
Gemma 3는 1B, 4B, 12B, 27B 네 가지 크기로 제공돼요. 각각 사전훈련(pre-trained) 모델과 범용 지시 튜닝(instruction-tuned) 버전으로 나뉘어요.
멀티모달
이미지 입력을 지원해서 이미지 분석, 이미지에 대한 질문 답변, 이미지 비교, 객체 식별, 이미지 속 텍스트 응답이 가능해요. 통합 비전 인코더는 SigLIP 기반이고, 4B·12B·27B에서 같은 비전 모델을 공유해요. 원래 896x896 픽셀 이미지용으로 만들어졌지만, 적응형 윈도우 알고리즘으로 고해상도·비정사각 이미지도 처리해요.
훈련
사전훈련·포스트트레이닝을 증류(distillation), 강화학습, 모델 병합으로 최적화했어요. 훈련 토큰 수는 1B=2T, 4B=4T, 12B=12T, 27B=14T이고, Google TPU에서 JAX 프레임워크로 훈련했어요.
텍스트 입력은 Gemma 2와 동일
Instruct 버전은 Gemma 2와 같은 대화 포맷을 써서, 텍스트만 쓰는 기존 도구를 버전 업그레이드할 필요가 없어요.