BitsAndBytes 12비트
BitsAndBytes 12비트 (B12X)
양자화 방식은 4비트만 있는 게 아니에요. BitsAndBytes 12비트(B12X) 는 vLLM이 지원하는 또 하나의 양자화 경로예요. 이 페이지는 BitsAndBytes 기반 12비트 양자화의 지원 구성에 대해 다룹니다.
지원되는 구성 (Supported Configurations)
이 페이지는 vLLM의 양자화(Quantization) 섹션 아래 지원 구성 항목에 속해 있어요. 같은 범주의 다른 양자화 방식들과 함께 정리되어 있죠.
- BitsAndBytes
- FP8 ViT Encoder Attention
- GGUF
- GPTQModel
- Intel Quantization Support
- NVIDIA Model Optimizer
- Online Quantization
- Quantized KV Cache
- AMD Quark
- TorchAO
- LLM Compressor
vLLM 내부 패키지 구조(vllm.model_executor.layers.quantization)를 보면 auto_gptq, awq_triton, fp8, kv_cache, modelopt, mxfp4, torchao, compressed_tensors 등 여러 양자화 구현체가 함께 등록되어 있는 걸 볼 수 있어요.
⚠️ 확인 필요: 원본 페이지의 본문 상세 내용(구체적인 설정 예시와 파라미터)은 이 글 작성 시점의 크롤링에서 완전히 확보되지 못했어요. 보다 정확한 B12X 사용법과 지원 세부 사항은 vLLM 공식 문서 및 BitsAndBytes 문서를 직접 확인해 주세요.