ExLlama 서버와 성능 — TabbyAPI와 추론 속도
ExLlama 서버와 성능
ExLlamaV2의 공식 권장 백엔드 서버는 TabbyAPI예요. FastAPI 기반으로 만들어진 서버로, 로컬이든 원격이든 OpenAI 호환 API를 제공해요. HF 모델 다운로드, 임베딩 모델 지원, HF Jinja2 채팅 템플릿 지원 같은 확장 기능도 있어요. SillyTavern 같은 프론트엔드와 바로 붙는 것이 큰 장점이죠.
서버/통합 옵션
- TabbyAPI — FastAPI 기반 OpenAI 스타일 웹 API
- ExUI — 단일 사용자용 독립 웹 UI (채팅 + 노트북 모드)
- text-generation-webui —
exllamav2,exllamav2_HF로더로 지원 - lollms-webui — exllamav2 바인딩으로 지원
성능표 (일부)
공식 README의 성능표 중 일부예요. 3090Ti와 4090에서의 처리량(t/s) 비교예요.
| Model | Mode | Size | grpsz | act | 3090Ti | 4090 |
|---|---|---|---|---|---|---|
| Llama | GPTQ | 7B | 128 | no | 181 t/s | 205 t/s |
| Llama | GPTQ | 13B | 128 | no | 110 t/s | 114 t/s |
| Llama2 | EXL2 2.5 bpw | 70B | - | - | 33 t/s | 38 t/s |
| TinyLlama | EXL2 3.0 bpw | 1.1B | - | - | 656 t/s | 770 t/s |
소형 모델을 낮은 bitrate로 굴리면 초당 수백~수천 토큰까지 나오는 걸 볼 수 있어요.