양자화 (Quantization)
양자화 (Quantization)
모델 크기와 추론 비용을 줄이려면 가중치를 저비트로 바꾸는 게 효과적이에요. CTranslate2는 기본 float32 대신 int8, int16, float16 중 골라서 양자화할 수 있어요.
converter.convert("ct2_model", quantization="int8")
어떤 걸 고를까
- int8: 가장 널리 쓰이는 선택. 정확도 손실을 줄이면서 메모리와 속도를 확 줄여요.
- float16: GPU 반정밀도 연산에 적합해요.
- int16: 정확도에 민감할 때 int8보다 안전한 중간 지점.
확인 포인트
- 양자화는 로드 시점이 아니라 변환 시점에 결정돼요.
- 비트 폭 설정이므로 바꾸면 결과와 메모리 사용량도 달라져요.