허브에서 GGUF 다루기 — 모델 카드와 파일
허브에서 GGUF 다루기 — 모델 카드와 파일
Hugging Face 허브에는 GGUF 파일로 변환된 모델이 수두룩해요. 허브는 이런 GGUF 모델을 표시·배포·활용하는 방법을 공식 문서로 안내하고 있어요.
GGUF 모델을 허브에서 다루는 핵심은 모델 카드예요. 카드에 GGUF 파일을 올리고 설명을 달면, 사용자는 카드에서 어떤 양자화 버전(Q4_K_M, Q5_K_M 등)을 내려받을지 고를 수 있어요. 보통 하나의 모델 저장소에 여러 양자화 단계의 GGUF 파일이 함께 들어 있어요.
허브의 GGUF 문서는 관례상 *.gguf 확장자를 가진 파일을 어떻게 구성·라벨링하는지, 그리고 다운로드와 추론 도구(예: llama.cpp)와 어떻게 이어지는지를 설명해요. 파일명만으로도 모델 크기와 양자화 방식을 한눈에 알 수 있게 명명 규칙을 쓰는 게 관례예요.
사용자 입장에서 GGUF 모델을 쓸 때는, 원본(보통 FP16) 모델과 양자화된 GGUF 중 어느 것을 쓸지 정하고, 자기 하드웨어(VRAM/CPU)에 맞는 파일을 내려받으면 돼요. 이 문서는 허브 위에서 그 흐름을 정리한 참고 자료예요.
더 알아보기
- https://huggingface.co/docs/hub/en/gguf — 허브 GGUF 문서
- https://github.com/ggml-org/ggml/blob/master/docs/gguf.md — GGUF 스펙