ExLlamaV2 시작하기 — 설치와 첫 추론
ExLlamaV2 시작하기
ExLlamaV2는 로컬 LLM을 현대 소비자 GPU에서 돌리기 위한 추론 라이브러리예요. 공식 README는 이 프로젝트는 지금 아카이브로 보관 중이고, 개발은 ExLlamaV3로 계속된다고 안내해요. 그래도 EXL2 포맷과 GPTQ 양자화 모델을 지원하는 v0.1.0 이상의 기능은 그대로 쓰임새가 있죠.
설치
소스에서 설치하는 방법은 다음과 같아요. 먼저 저장소를 clone 하고, 의존성을 받은 뒤 설치하면 됩니다.
git clone https://github.com/turboderp/exllamav2
cd exllamav2
pip install -r requirements.txt
pip install .
릴리스 페이지에는 플랫폼·Python 버전(cp)·CUDA 버전에 맞는 prebuilt 휠도 있어요. 받을 때는 반드시 자기 환경에 맞는 버전을 골라야 해요.
간단한 추론
설치 후 이렇게 바로 추론해 볼 수 있어요.
python test_inference.py -m <path_to_model> -p "Once upon a time,"
멀티 GPU라면 --gpu_split auto 플래그를 붙여요. 포함된 콘솔 챗봇도 있는데, -mode 인자로 프롬프트 포맷을 고르고 -modes로 사용 가능한 포맷 목록을 볼 수 있어요. 커스텀 시스템 프롬프트는 -sp로 넣습니다.
v0.1.0+ 의 새 기능
- Flash Attention 2.5.7+ 기반 paged attention 지원
- 동적 배칭(dynamic batching), 스마트 프롬프트 캐싱, K/V 캐시 중복 제거가 담긴 새 generator
더 알아보기
- ExLlamaV3 — 개발이 이어지는 후속 저장소
- TabbyAPI — 공식 권장 서버
- ExLlamaV2 저장소