ExLlama 서버와 성능 — TabbyAPI와 추론 속도

ExLlama 서버와 성능

ExLlamaV2의 공식 권장 백엔드 서버는 TabbyAPI예요. FastAPI 기반으로 만들어진 서버로, 로컬이든 원격이든 OpenAI 호환 API를 제공해요. HF 모델 다운로드, 임베딩 모델 지원, HF Jinja2 채팅 템플릿 지원 같은 확장 기능도 있어요. SillyTavern 같은 프론트엔드와 바로 붙는 것이 큰 장점이죠.

서버/통합 옵션

  • TabbyAPI — FastAPI 기반 OpenAI 스타일 웹 API
  • ExUI — 단일 사용자용 독립 웹 UI (채팅 + 노트북 모드)
  • text-generation-webuiexllamav2, exllamav2_HF 로더로 지원
  • lollms-webui — exllamav2 바인딩으로 지원

성능표 (일부)

공식 README의 성능표 중 일부예요. 3090Ti와 4090에서의 처리량(t/s) 비교예요.

Model Mode Size grpsz act 3090Ti 4090
Llama GPTQ 7B 128 no 181 t/s 205 t/s
Llama GPTQ 13B 128 no 110 t/s 114 t/s
Llama2 EXL2 2.5 bpw 70B - - 33 t/s 38 t/s
TinyLlama EXL2 3.0 bpw 1.1B - - 656 t/s 770 t/s

소형 모델을 낮은 bitrate로 굴리면 초당 수백~수천 토큰까지 나오는 걸 볼 수 있어요.

더 알아보기