KTransformers GitHub — 프레임워크의 연구 프로젝트

KTransformers GitHub

KTransformers는 CPU-GPU 이기종 컴퓨팅을 통한 효율적 LLM 추론·파인튜닝을 연구하는 프로젝트예요. GitHub 저장소에서 최신 업데이트, 성능 벤치마크, 튜토리얼, 인용 정보를 확인할 수 있습니다.

출처: https://github.com/kvcache-ai/ktransformers

두 가지 사용자 기능

  1. Inference (kt-kernel) — 고성능 kt-kernel 서빙

    • AMX/AVX 가속: Intel AMX·AVX512/AVX2 최적화 커널로 INT4/INT8 양자화 추론
    • MoE 최적화: NUMA 인지 메모리 관리로 효율적 MoE 추론
    • 양자화 지원: CPU 측 INT4/INT8, GPU 측 GPTQ
    • SGLang 통합: SGLang 및 다른 프레임워크를 위한 깨끗한 Python API
  2. SFT (파인튜닝) — LLaMA-Factory 통합

    • 멀티 백엔드: CPU/GPU 하이브리드 파인튜닝 (INT8/INT4 양자화)
    • 초대형 MoE 지원: DeepSeek-V3/R1 같은 모델을 제한된 GPU 메모리로 파인튜닝
    • ZeRO-Offload보다 빠름: 벤치마크 MoE SFT 워크로드에서 6-12배 학습 속도 향상

성능 예시

모델 GPU 메모리 학습 속도 하드웨어
DeepSeek-V3 ~80GB 3.7 it/s 4x RTX 4090
Qwen3-30B-A3B ~24GB 8+ it/s 1x RTX 4090

인용

연구에 사용하면 연중 발표된 ACM SIGOPS SOSP 2025 논문을 인용하라고 안내해요.

더 알아보기