TorchAO
TorchAO (TorchAO)
모델을 PyTorch 생태계에서 양자화하고 싶다면 TorchAO를 들어봤을 거예요. TorchAO는 PyTorch용 아키텍처 최적화 라이브러리로, 추론과 훈련을 위한 고성능 데이터 타입·최적화 기법·커널을 제공하면서 torch.compile, FSDP 같은 네이티브 PyTorch 기능과의 조합(composability)이 특징이에요. 이 페이지에서 TorchAO로 모델을 양자화하고 vLLM에서 쓰는 방법을 살펴볼게요.
설치 (Installation)
최신 TorchAO nightly 빌드를 설치하는 걸 권장해요. 시스템에 맞는 CUDA 버전(cu126, cu128 등)을 선택하세요.
# 최신 TorchAO nightly 빌드 설치
# 시스템과 일치하는 CUDA 버전 선택 (cu126, cu128 등)
pip install \
--pre torchao>=10.0.0 \
--index-url https://download.pytorch.org/whl/nightly/cu126
일부 벤치마크 수치는 TorchAO 양자화 디렉터리에서 확인할 수 있어요.
HuggingFace 모델 양자화하기 (Quantizing HuggingFace models)
자신의 HuggingFace 모델을 torchao로 양자화할 수 있어요. 예를 들어 transformers와 diffusers에서 torchao 양자화를 쓸 수 있고, 예시처럼 jerryzh168/llama3-8b-int8wo 체크포인트를 만들어 HuggingFace hub에 저장할 수 있어요.
import torch
from transformers import TorchAoConfig, AutoModelForCausalLM, AutoTokenizer
from torchao.quantization import ...
(위 코드는 예시 구조이며, 양자화 적용·저장의 구체적 코드는 원문 예시 링크 참고 — 확인 필요)
또는 TorchAO Quantization space를 사용하면 간단한 UI로 모델을 양자화할 수도 있어요.
참고: 이 페이지의 정확한 코드 블록 전문은 브라우저 렌더링 텍스트에서 빠져 있어 확인이 필요해요. 핵심 개념은 위와 같아요.