KTransformers 문서 — 추론과 파인튜닝 이해하기

KTransformers 문서

KTransformers 문서는 CPU-GPU 이기종 컴퓨팅 기반의 대형 MoE 모델 추론과 LoRA 파인튜닝을 설명해요. 모델 패밀리를 고르고, 그 다음 추론·학습·기술 배경·하드웨어 경계·명령 참조를 같은 관점에서 읽도록 구성돼 있습니다.

출처: https://ktransformers.net/en/docs

공개 표면

작업 공개 패키지 주요 진입점
추론 서빙 kt-kernel, sglang-kt kt run 또는 python -m sglang.launch_server + --kt-* 인자
LoRA SFT ktransformers[sft] (LLaMA-Factory 경유) use_kt: true가 있는 LLaMA-Factory YAML + Accelerate KT 설정

주요 주제

  • 모델 사용: DeepSeek, Kimi, MiniMax, Qwen, GLM별 시작 지점
  • 파인튜닝: LoRA SFT 워크플로, LLaMA-Factory 연동, AMXBF16/AMXINT8/AMXINT4 백엔드
  • 고급 기능: 서버 인자, 정밀도·양자화(BF16·FP8·RAWINT4·AMXINT4·MXFP4·LLAMAFILE), 전문가 배치, Layerwise Prefill
  • 지원 매트릭스: 모델·정밀도·백엔드·검증 상태

명령 참조

Internet·명령줄(kt) 인터페이스와 문제 해결(troubleshooting) 가이드가 있어요.

더 알아보기