모델 얻기와 양자화
모델 얻기와 양자화
llama.cpp에서 실행할 모델은 Hugging Face 플랫폼에 GGUF 포맷으로 먼저 갖춰져 있어요. 모델을 어떻게 받아 실행하는지, 그리고 다른 포맷을 GGUF로 바꾸고 양자화하는 방법까지 정리해 드릴게요.
Hugging Face에서 받아 바로 실행
Hugging Face에는 llama.cpp 호환 모델이 수천 개 있어요. CLI 인자 -hf <user>/<model>[:quant] 형태로 지정하면 바로 받아서 쓸 수 있어요.
llama cli -hf ggml-org/gemma-3-1b-it-GGUF
같은 방식으로 MODEL_ENDPOINT 환경 변수를 Hugging Face API 호환 엔드포인트로 바꾸면 다른 사이트에서도 내려받을 수 있어요. 물론 이미 로컬에 받아 둔 모델도 실행할 수 있어요.
GGUF 포맷과 변환
llama.cpp는 모델이 GGUF 파일 포맷으로 저장돼 있어야 해요. 다른 포맷의 모델은 저장소의 convert_*.py 파이썬 스크립트로 GGUF로 변환할 수 있고, 양자화는 quantize 문서를 참고하면 돼요.
Hugging Face가 제공하는 온라인 도구를 쓸 수도 있어요:
- GGUF-my-repo space — GGUF 변환과 가중치 양자화
- GGUF-my-LoRA space — LoRA 어댑터를 GGUF로 변환
- GGUF-editor space — 브라우저에서 GGUF 메타데이터 편집
- Inference Endpoints — 클라우드에서 llama.cpp 직접 호스팅
더 알아보기
- llama.cpp 빠른 시작 — 모델 실행 흐름
- llama-server — 서빙 옵션