KTransformers 소개 — 소비자 하드웨어에서 거대 MoE 모델 실행

KTransformers 소개

거대 MoE(Mixture-of-Experts) 모델은 파라미터가 많아 GPU 한 장에 들어가기 어려워요. KTransformers는 이런 모델을 CPU·GPU 이기종 컴퓨팅으로 실행하는 LLM 추론·파인튜닝 프레임워크예요. CPU 메모리와 연산을 활용해, 소비자 하드웨어로 로컬 배포의 장벽을 낮추는 게 목표입니다.

출처: https://ktransformers.net/en

핵심 강점

  • 이기종 컴퓨팅: CPU·GPU·가속기를 함께 최적화해 소비자 하드웨어에서 대형 모델 실행
  • 풀프리시전 추론: 양자화 없이 원본 정밀도를 보존해 추론 품질 유지
  • 풀스택 추론·파인튜닝: 추론부터 LoRA 파인튜닝까지 로컬 개발 도구체인 제공
  • 멀티 모델 지원: DeepSeek, Kimi, GLM, Qwen, MiniMax 등 주류 대형 모델 지원
  • SGLang 기반: GPU 추론은 SGLang이 처리해 성능 결합

성능 예시

MiniMax-M2.1 FP8 풀프리시전, 단일 GPU(32K 토큰 입력) 벤치마크:

  • Prefill: 2,540 tokens/s (1x RTX 5090 32GB + 2x AMD EPYC 9355)
  • Decode: 27.6 tokens/s
  • Prefill Speedup: llama.cpp(Q8_0 양자화) 대비 4.5배

더 알아보기