양자화 모델의 성능

양자화 모델의 성능

이 섹션은 Qwen2 시리즈의 양자화 모델(GPTQ와 AWQ 포함)의 생성 성능을 정리한 표예요. 구체적으로 다음 지표를 보고해요: MMLU(정확도), C-Eval(정확도), IFEval(Strict Prompt-Level 정확도). 모든 모델 평가에는 greedy 디코딩을 사용했어요.

출처: 문서

본문

⚠️ 주의: 이 페이지는 Qwen3 기준으로 업데이트 예정이에요.

이 절에서는 Qwen2 시리즈의 양자화 모델(GPTQ 및 AWQ 포함)의 생성 성능을 보고합니다. 구체적으로 다음 지표를 보고해요:

  • MMLU (Accuracy)
  • C-Eval (Accuracy)
  • IFEval (Strict Prompt-Level Accuracy)

모든 모델 평가에서 greedy 디코딩을 사용했어요.

양자화 평균 MMLU C-Eval IFEval
Qwen2-72B-Instruct / BF16 81.3 82.3 83.8 77.6
Qwen2-72B-Instruct / GPTQ-Int8 80.7 81.3 83.4 77.5
Qwen2-72B-Instruct / GPTQ-Int4 81.2 80.8 83.9 78.9
Qwen2-72B-Instruct / AWQ 80.4 80.5 83.9 76.9
Qwen2-7B-Instruct / BF16 66.9 70.5 77.2 53.1
Qwen2-7B-Instruct / GPTQ-Int8 66.2 69.1 76.7 52.9
Qwen2-7B-Instruct / GPTQ-Int4 64.1 67.8 75.2 49.4
Qwen2-7B-Instruct / AWQ 64.1 67.4 73.6 51.4
Qwen2-1.5B-Instruct / BF16 48.4 52.4 63.8 29.0
Qwen2-1.5B-Instruct / GPTQ-Int8 48.1 53.0 62.5 28.8
Qwen2-1.5B-Instruct / GPTQ-Int4 45.0 50.7 57.4 27.0
Qwen2-1.5B-Instruct / AWQ 46.5 51.6 58.1 29.9
Qwen2-0.5B-Instruct / BF16 34.4 37.9 45.2 20.0
Qwen2-0.5B-Instruct / GPTQ-Int8 32.6 35.6 43.9 18.1
Qwen2-0.5B-Instruct / GPTQ-Int4 29.7 33.0 39.2 16.8
Qwen2-0.5B-Instruct / AWQ 31.1 34.4 42.1 16.7

표를 보면 모델이 작아질수록 전반적인 정확도가 낮아지고, 양자화 비트 수가 낮아질수록 성능이 조금씩 떨어지는 패턴을 확인할 수 있어요. 그래도 양자화된 모델도 BF16 대비 큰 손실 없이 실용적인 수준의 성능을 유지하는 걸 볼 수 있어요.

더 알아보기 (Learn more)