ExLlama — 로컬 LLM 고속 추론 라이브러리
ExLlama
ExLlama는 현대 소비자 GPU에서 로컬 LLM을 빠르게 돌리기 위한 추론 라이브러리예요. 공식 README가 ExLlamaV2로 이어지면서 EXL2라는 독자적인 양자화 포맷까지 도입해, 같은 모델을 더 작은 GPU 메모리로 더 빨리 굴리는 것이 핵심 목표예요. 현재 ExLlamaV2는 아카이브(보관) 상태이고, 개발은 ExLlamaV3로 이어지고 있어요.
이 카테고리의 문서
- 시작과 설치: 소스 빌드, prebuilt 휠 설치, 간단 추론
- EXL2 양자화: 2~8bit 혼합 양자화 포맷 만들기
- 서버/API: OpenAI 호환 TabbyAPI 서버와 성능표