bitsandbytes (k-bit 양자화)

bitsandbytes (k-bit 양자화)

bitsandbytes는 PyTorch를 위한 k-bit 양자화 라이브러리로, 대형 언어 모델을 접근 가능하게 만드는 데 초점을 맞춰요. 추론과 학습 모두에서 메모리 소비를 극적으로 줄여줘요.

세 가지 핵심 기능이 있어요 — 8-bit 옵티마이저(블록 단위 양자화로 32-bit 성능 유지), LLM.int8()(절반 메모리로 무성능 저하 추론), QLoRA/4-bit 양자화(메모리 절감 기법으로 저메모리 학습)예요. MIT 라이선스로 배포돼요.

핵심 개념

  • 8-bit Optimizers — 블록 단위 양자화로 메모리 최소화
  • LLM.int8() — 벡터 단위 양자화 + outlier 16-bit 처리
  • QLoRA / 4-bit — 4-bit 모델 + 학습 가능 LoRA 가중치
  • Transformers 통합 — BitsAndBytesConfig로 로드

이 카테고리의 문서

  • 라이브러리 개요: 접근 가능한 LLM을 위한 양자화
  • 양자화 가이드: 8-bit/4-bit 로드·설정
  • Transformers 연동: BytesAndBytesConfig 사용법

출처: https://huggingface.co/docs/bitsandbytes/main/en/index