API 엔드포인트와 GGUF 모델 확보

API 엔드포인트와 GGUF 모델 확보

로컬 서버를 띄웠다면 다른 프로그램이 어떻게 호출하는지어떤 모델 파일을 쓸지가 남아요. KoboldCpp는 여러 API를 제공하고, 모델은 GGUF 파일을 확보하면 돼요.

출처: https://github.com/LostRuins/koboldcpp/wiki

API 엔드포인트: 서버가 뜨면 문서는 /api에서 확인할 수 있어요. 예를 들어 기본 주소가 http://localhost:5001이라면 http://localhost:5001/api로 접속하면 되고, OpenAI 호환 API는 /v1 경로(예: http://localhost:5001/v1)로 제공돼요. 그래서 OpenAI 클라이언트를 base URL만 바꿔서 쓸 수도 있어요.

GGUF 모델 확보: KoboldCpp는 GGUF 모델을 사용하는데, 모델 파일은 KoboldCpp에 포함돼 있지 않아요. Hugging Face에서 내려받으면 되고, bartowski 같은 업로더가 다양한 양자화 단계의 GGUF 파일을 올려놓았어요. 추천 모델로는 초보자에게 안정적인 Qwen3-VL-8B(Q4_K_S)이 있고, 창작·롤플레이용으로는 L3-8B-Stheno-v3.2, Tiefighter 13B 같은 것들이 있어요.

직접 변환하고 싶다면 도구를 내려받아 convert-hf-to-gguf.py로 Hugging Face 모델을 GGUF로 바꾸고, quantize_gguf.exe로 양자화할 수 있어요. 음성 인식(Whisper), 이미지 생성, TTS용 모델은 위키에서 별도로 안내해요.

거의 모든 최신 GGUF 모델이 호환되고, 오래된 GGML .bin 모델도 하위 호환으로 지원되지만 일부 신기능은 못 쓸 수 있어요. 지원 아키텍처엔 Llama/Llama3, Mistral/Mixtral, Qwen/Qwen2, Gemma/Gemma2, Phi-2/Phi-3, Falcon, DeepSeek 등 수백 가지가 있어요.

더 알아보기