llama.cpp 빠른 시작

llama.cpp 빠른 시작

llama.cpp를 내 컴퓨터에서 바로 실행해 보려고 하신다면, 설치 경로부터 모델 실행까지 한 흐름으로 정리해 드릴게요. 설치 방법은 네 가지, 그다음엔 모델 하나만 지정하면 CLI든 API 서버든 바로 쓸 수 있어요.

출처: llama.cpp README

설치 방법 고르기

llama.cpp는 상황에 따라 네 가지 방법 중 하나로 설치할 수 있어요.

모델 실행해 보기

설치가 끝나면 Hugging Face에서 모델을 바로 받아 실행할 수 있어요.

# Hugging Face에서 모델을 받아 바로 실행
llama cli -hf ggml-org/Qwen3.5-0.8B-GGUF

# OpenAI 호환 API 서버 띄우기
llama serve -hf ggml-org/Qwen3.5-0.8B-GGUF

-hf <user>/<model> 형태로 저장소 이름만 지정하면, GGUF 포맷 모델을 자동으로 내려받고 실행해요. llama cli는 터미널에서 대화를, llama serve는 HTTP 서버를 띄워요.

이 프로젝트가 지향하는 것

llama.cpp의 핵심 목표는 LLM(그리고 VLM) 추론을 최소한의 설정으로, 다양한 하드웨어에서 최신 수준의 성능으로 실행하는 거예요.

  • 의존성 없는 순수 C/C++ 구현
  • Apple Silicon 1급 지원 — ARM NEON, Accelerate, Metal로 최적화
  • x86은 AVX, AVX2, AVX512, AMX 지원
  • RISC-V는 RVV, ZVFH, ZFH, ZICBOP, ZIHINTPAUSE 지원
  • 1.5~8비트 정수 양자화로 더 빠른 추론과 메모리 절약
  • NVIDIA GPU용 커스텀 CUDA 커널 (AMD는 HIP, Moore Threads는 MUSA)
  • Vulkan, SYCL 백엔드 지원
  • GPU 메모리보다 큰 모델을 CPU+GPU 하이브리드로 추론

llama.cpp는 ggml 라이브러리 위에 만들어져요.

더 알아보기