KTransformers — CPU·GPU 이기종 컴퓨팅으로 로컬 LLM 추론·파인튜닝
KTransformers
100B 이상의 거대 모델을 로컬에서 돌리려면 GPU 메모리가 턱없이 부족해요. KTransformers는 CPU·GPU 이기종(heterogeneous) 컴퓨팅으로 이 문제를 푸는 LLM 추론·파인튜닝 프레임워크예요. CPU 메모리와 연산을 함께 활용해 소비자 GPU(예: RTX 5090 32GB) 하나로도 100B+ 파라미터 모델을 풀프리시전으로 배포할 수 있게 해줍니다. MoE 모델 추론 가속과 저VRAM 풀파라미터 파인튜닝이 핵심 기능이에요.
이 카테고리의 문서
- 소개: KTransformers의 비전과 핵심 성능
- 문서: 설치·추론·파인튜닝 가이드
- 저장소: GitHub 소스와 튜토리얼