KTransformers 문서 — 추론과 파인튜닝 이해하기
KTransformers 문서
KTransformers 문서는 CPU-GPU 이기종 컴퓨팅 기반의 대형 MoE 모델 추론과 LoRA 파인튜닝을 설명해요. 모델 패밀리를 고르고, 그 다음 추론·학습·기술 배경·하드웨어 경계·명령 참조를 같은 관점에서 읽도록 구성돼 있습니다.
공개 표면
| 작업 | 공개 패키지 | 주요 진입점 |
|---|---|---|
| 추론 서빙 | kt-kernel, sglang-kt |
kt run 또는 python -m sglang.launch_server + --kt-* 인자 |
| LoRA SFT | ktransformers[sft] (LLaMA-Factory 경유) |
use_kt: true가 있는 LLaMA-Factory YAML + Accelerate KT 설정 |
주요 주제
- 모델 사용: DeepSeek, Kimi, MiniMax, Qwen, GLM별 시작 지점
- 파인튜닝: LoRA SFT 워크플로, LLaMA-Factory 연동, AMXBF16/AMXINT8/AMXINT4 백엔드
- 고급 기능: 서버 인자, 정밀도·양자화(BF16·FP8·RAWINT4·AMXINT4·MXFP4·LLAMAFILE), 전문가 배치, Layerwise Prefill
- 지원 매트릭스: 모델·정밀도·백엔드·검증 상태
명령 참조
Internet·명령줄(kt) 인터페이스와 문제 해결(troubleshooting) 가이드가 있어요.