개요 (소형 언어 모델과 Phi-3)

개요 (소형 언어 모델과 Phi-3)

Phi-3는 Microsoft가 만든 소형 언어 모델(SLM) 시리즈예요. Phi-3 기술 보고서의 초록을 보면 핵심이 잘 드러나요.

"phi-3-mini는 38억 파라미터 언어 모델로, 3.3조 토큰으로 훈련했고, Mixtral 8x7B와 GPT-3.5 같은 모델과 견줄 만한 성능을 냅니다(phi-3-mini는 MMLU 69%, MT-bench 8.38). 그런데도 휴대폰에 배포될 만큼 작아요. 혁신은 전적으로 훈련 데이터셋에 있습니다 — phi-2에 쓰인 것의 확장판으로, 강하게 필터링된 웹 데이터와 합성 데이터로 구성돼요."

"또한 4.8T 토큰으로 훈련된 7B, 14B 모델인 phi-3-small과 phi-3-medium에 대한 초기 파라미터 스케일링 결과도 제공합니다(각각 MMLU 75%·78%, MT-bench 8.7·8.9)."

핵심 특징

  • 작은 크기, 높은 성능 — 휴대폰·에지 배포에도 적합한 크기로 큰 모델급 성능
  • 데이터 중심 혁신 — 강하게 필터링된 웹 데이터 + 합성 데이터로 훈련
  • 견고함·안전성·채팅 정렬 — 추가 정렬(alignment)을 거쳐 견고성·안전·챗 포맷을 갖춤

토크나이저

Phi-3의 토크나이저는 추가 토큰을 제외하면 LlamaTokenizer와 동일해요. 이 점 때문에 기존 Llama 생태계의 도구·워크플로와도 친숙하게 다룰 수 있어요.

더 알아보기