KTransformers 소개 — 소비자 하드웨어에서 거대 MoE 모델 실행
KTransformers 소개
거대 MoE(Mixture-of-Experts) 모델은 파라미터가 많아 GPU 한 장에 들어가기 어려워요. KTransformers는 이런 모델을 CPU·GPU 이기종 컴퓨팅으로 실행하는 LLM 추론·파인튜닝 프레임워크예요. CPU 메모리와 연산을 활용해, 소비자 하드웨어로 로컬 배포의 장벽을 낮추는 게 목표입니다.
핵심 강점
- 이기종 컴퓨팅: CPU·GPU·가속기를 함께 최적화해 소비자 하드웨어에서 대형 모델 실행
- 풀프리시전 추론: 양자화 없이 원본 정밀도를 보존해 추론 품질 유지
- 풀스택 추론·파인튜닝: 추론부터 LoRA 파인튜닝까지 로컬 개발 도구체인 제공
- 멀티 모델 지원: DeepSeek, Kimi, GLM, Qwen, MiniMax 등 주류 대형 모델 지원
- SGLang 기반: GPU 추론은 SGLang이 처리해 성능 결합
성능 예시
MiniMax-M2.1 FP8 풀프리시전, 단일 GPU(32K 토큰 입력) 벤치마크:
- Prefill: 2,540 tokens/s (1x RTX 5090 32GB + 2x AMD EPYC 9355)
- Decode: 27.6 tokens/s
- Prefill Speedup: llama.cpp(Q8_0 양자화) 대비 4.5배