BitsAndBytes 12비트

BitsAndBytes 12비트 (B12X)

양자화 방식은 4비트만 있는 게 아니에요. BitsAndBytes 12비트(B12X) 는 vLLM이 지원하는 또 하나의 양자화 경로예요. 이 페이지는 BitsAndBytes 기반 12비트 양자화의 지원 구성에 대해 다룹니다.

출처: vLLM 공식 문서 — quantization/b12x

지원되는 구성 (Supported Configurations)

이 페이지는 vLLM의 양자화(Quantization) 섹션 아래 지원 구성 항목에 속해 있어요. 같은 범주의 다른 양자화 방식들과 함께 정리되어 있죠.

  • BitsAndBytes
  • FP8 ViT Encoder Attention
  • GGUF
  • GPTQModel
  • Intel Quantization Support
  • NVIDIA Model Optimizer
  • Online Quantization
  • Quantized KV Cache
  • AMD Quark
  • TorchAO
  • LLM Compressor

vLLM 내부 패키지 구조(vllm.model_executor.layers.quantization)를 보면 auto_gptq, awq_triton, fp8, kv_cache, modelopt, mxfp4, torchao, compressed_tensors 등 여러 양자화 구현체가 함께 등록되어 있는 걸 볼 수 있어요.

⚠️ 확인 필요: 원본 페이지의 본문 상세 내용(구체적인 설정 예시와 파라미터)은 이 글 작성 시점의 크롤링에서 완전히 확보되지 못했어요. 보다 정확한 B12X 사용법과 지원 세부 사항은 vLLM 공식 문서BitsAndBytes 문서를 직접 확인해 주세요.

더 알아보기 (Learn more)