모델 얻기와 양자화

모델 얻기와 양자화

llama.cpp에서 실행할 모델은 Hugging Face 플랫폼에 GGUF 포맷으로 먼저 갖춰져 있어요. 모델을 어떻게 받아 실행하는지, 그리고 다른 포맷을 GGUF로 바꾸고 양자화하는 방법까지 정리해 드릴게요.

출처: llama.cpp models 문서

Hugging Face에서 받아 바로 실행

Hugging Face에는 llama.cpp 호환 모델이 수천 개 있어요. CLI 인자 -hf <user>/<model>[:quant] 형태로 지정하면 바로 받아서 쓸 수 있어요.

llama cli -hf ggml-org/gemma-3-1b-it-GGUF

같은 방식으로 MODEL_ENDPOINT 환경 변수를 Hugging Face API 호환 엔드포인트로 바꾸면 다른 사이트에서도 내려받을 수 있어요. 물론 이미 로컬에 받아 둔 모델도 실행할 수 있어요.

GGUF 포맷과 변환

llama.cpp는 모델이 GGUF 파일 포맷으로 저장돼 있어야 해요. 다른 포맷의 모델은 저장소의 convert_*.py 파이썬 스크립트로 GGUF로 변환할 수 있고, 양자화는 quantize 문서를 참고하면 돼요.

Hugging Face가 제공하는 온라인 도구를 쓸 수도 있어요:

더 알아보기