KTransformers GitHub — 프레임워크의 연구 프로젝트
KTransformers GitHub
KTransformers는 CPU-GPU 이기종 컴퓨팅을 통한 효율적 LLM 추론·파인튜닝을 연구하는 프로젝트예요. GitHub 저장소에서 최신 업데이트, 성능 벤치마크, 튜토리얼, 인용 정보를 확인할 수 있습니다.
두 가지 사용자 기능
-
Inference (kt-kernel) — 고성능 kt-kernel 서빙
- AMX/AVX 가속: Intel AMX·AVX512/AVX2 최적화 커널로 INT4/INT8 양자화 추론
- MoE 최적화: NUMA 인지 메모리 관리로 효율적 MoE 추론
- 양자화 지원: CPU 측 INT4/INT8, GPU 측 GPTQ
- SGLang 통합: SGLang 및 다른 프레임워크를 위한 깨끗한 Python API
-
SFT (파인튜닝) — LLaMA-Factory 통합
- 멀티 백엔드: CPU/GPU 하이브리드 파인튜닝 (INT8/INT4 양자화)
- 초대형 MoE 지원: DeepSeek-V3/R1 같은 모델을 제한된 GPU 메모리로 파인튜닝
- ZeRO-Offload보다 빠름: 벤치마크 MoE SFT 워크로드에서 6-12배 학습 속도 향상
성능 예시
| 모델 | GPU 메모리 | 학습 속도 | 하드웨어 |
|---|---|---|---|
| DeepSeek-V3 | ~80GB | 3.7 it/s | 4x RTX 4090 |
| Qwen3-30B-A3B | ~24GB | 8+ it/s | 1x RTX 4090 |
인용
연구에 사용하면 연중 발표된 ACM SIGOPS SOSP 2025 논문을 인용하라고 안내해요.