Phi-4 기술 보고서 — 훈련 데이터와 추론
Phi-4 기술 보고서 — 훈련 데이터와 추론
Phi-4를 만들 때 핵심 가설은 **'데이터 품질과 추론 밀집(reasoning-dense) 성질이야말로 작은 모델의 성능을 좌우한다'**는 것이에요. Phi-4 기술 보고서는 이 데이터 중심 접근을 상세히 설명해요.
출처: arXiv:2412.08929 (Phi-4 Technical Report)
데이터 전략
Phi-3에서 쓴 데이터를 확장한 훈련 데이터를 써요.
- 품질을 엄격히 필터링한 공개 문서 (고품질 교육 데이터와 코드 포함)
- 수학·코딩·상식 추론·세계 지식(과학, 일상 활동, theory of mind 등)을 가르치기 위한 새로 만든 합성 '교과서형' 데이터
- 확보한 학술 도서와 Q&A 데이터셋
- 명령 따르기·진실성·유용성 같은 인간 선호를 반영한 고품질 채팅 형식 지도 데이터
다국어 데이터는 전체의 약 8%예요. 필터링으로 모델이 추론 능력에 집중할 공간을 남겼어요(예: 스포츠 경기 결과 같은 단기 정보는 제거).
추론 강화
- MMLU, MATH, GPQA, DROP, MGSM, HumanEval, SimpleQA 등으로 평가했어요.
- Open-domain 합성 데이터가 상식 추론과 일반 지식 획득에 특히 큰 영향을 줬다는 게 보고서의 핵심 주장이에요.
- 정렬은 SFT + 반복적 DPO 조합으로 진행했어요.
안전
마이크로소프트 AI Red Team(AIRT)과 협력해 평균·적대적 사용자 시나리오에서 안전 위험을 평가했어요. 적대적 시나리오에는 jailbreak, 인코딩 기반 공격, 멀티턴 공격, adversarial suffix 공격이 포함돼요.