허브에서 GGUF 다루기 — 모델 카드와 파일

허브에서 GGUF 다루기 — 모델 카드와 파일

Hugging Face 허브에는 GGUF 파일로 변환된 모델이 수두룩해요. 허브는 이런 GGUF 모델을 표시·배포·활용하는 방법을 공식 문서로 안내하고 있어요.

출처: https://huggingface.co/docs/hub/en/gguf

GGUF 모델을 허브에서 다루는 핵심은 모델 카드예요. 카드에 GGUF 파일을 올리고 설명을 달면, 사용자는 카드에서 어떤 양자화 버전(Q4_K_M, Q5_K_M 등)을 내려받을지 고를 수 있어요. 보통 하나의 모델 저장소에 여러 양자화 단계의 GGUF 파일이 함께 들어 있어요.

허브의 GGUF 문서는 관례상 *.gguf 확장자를 가진 파일을 어떻게 구성·라벨링하는지, 그리고 다운로드와 추론 도구(예: llama.cpp)와 어떻게 이어지는지를 설명해요. 파일명만으로도 모델 크기와 양자화 방식을 한눈에 알 수 있게 명명 규칙을 쓰는 게 관례예요.

사용자 입장에서 GGUF 모델을 쓸 때는, 원본(보통 FP16) 모델과 양자화된 GGUF 중 어느 것을 쓸지 정하고, 자기 하드웨어(VRAM/CPU)에 맞는 파일을 내려받으면 돼요. 이 문서는 허브 위에서 그 흐름을 정리한 참고 자료예요.

더 알아보기