양자화 모델의 성능
양자화 모델의 성능
이 섹션은 Qwen2 시리즈의 양자화 모델(GPTQ와 AWQ 포함)의 생성 성능을 정리한 표예요. 구체적으로 다음 지표를 보고해요: MMLU(정확도), C-Eval(정확도), IFEval(Strict Prompt-Level 정확도). 모든 모델 평가에는 greedy 디코딩을 사용했어요.
출처: 문서
본문
⚠️ 주의: 이 페이지는 Qwen3 기준으로 업데이트 예정이에요.
이 절에서는 Qwen2 시리즈의 양자화 모델(GPTQ 및 AWQ 포함)의 생성 성능을 보고합니다. 구체적으로 다음 지표를 보고해요:
- MMLU (Accuracy)
- C-Eval (Accuracy)
- IFEval (Strict Prompt-Level Accuracy)
모든 모델 평가에서 greedy 디코딩을 사용했어요.
| 양자화 | 평균 | MMLU | C-Eval | IFEval |
|---|---|---|---|---|
| Qwen2-72B-Instruct / BF16 | 81.3 | 82.3 | 83.8 | 77.6 |
| Qwen2-72B-Instruct / GPTQ-Int8 | 80.7 | 81.3 | 83.4 | 77.5 |
| Qwen2-72B-Instruct / GPTQ-Int4 | 81.2 | 80.8 | 83.9 | 78.9 |
| Qwen2-72B-Instruct / AWQ | 80.4 | 80.5 | 83.9 | 76.9 |
| Qwen2-7B-Instruct / BF16 | 66.9 | 70.5 | 77.2 | 53.1 |
| Qwen2-7B-Instruct / GPTQ-Int8 | 66.2 | 69.1 | 76.7 | 52.9 |
| Qwen2-7B-Instruct / GPTQ-Int4 | 64.1 | 67.8 | 75.2 | 49.4 |
| Qwen2-7B-Instruct / AWQ | 64.1 | 67.4 | 73.6 | 51.4 |
| Qwen2-1.5B-Instruct / BF16 | 48.4 | 52.4 | 63.8 | 29.0 |
| Qwen2-1.5B-Instruct / GPTQ-Int8 | 48.1 | 53.0 | 62.5 | 28.8 |
| Qwen2-1.5B-Instruct / GPTQ-Int4 | 45.0 | 50.7 | 57.4 | 27.0 |
| Qwen2-1.5B-Instruct / AWQ | 46.5 | 51.6 | 58.1 | 29.9 |
| Qwen2-0.5B-Instruct / BF16 | 34.4 | 37.9 | 45.2 | 20.0 |
| Qwen2-0.5B-Instruct / GPTQ-Int8 | 32.6 | 35.6 | 43.9 | 18.1 |
| Qwen2-0.5B-Instruct / GPTQ-Int4 | 29.7 | 33.0 | 39.2 | 16.8 |
| Qwen2-0.5B-Instruct / AWQ | 31.1 | 34.4 | 42.1 | 16.7 |
표를 보면 모델이 작아질수록 전반적인 정확도가 낮아지고, 양자화 비트 수가 낮아질수록 성능이 조금씩 떨어지는 패턴을 확인할 수 있어요. 그래도 양자화된 모델도 BF16 대비 큰 손실 없이 실용적인 수준의 성능을 유지하는 걸 볼 수 있어요.