llama.cpp 빠른 시작
llama.cpp 빠른 시작
llama.cpp를 내 컴퓨터에서 바로 실행해 보려고 하신다면, 설치 경로부터 모델 실행까지 한 흐름으로 정리해 드릴게요. 설치 방법은 네 가지, 그다음엔 모델 하나만 지정하면 CLI든 API 서버든 바로 쓸 수 있어요.
출처: llama.cpp README
설치 방법 고르기
llama.cpp는 상황에 따라 네 가지 방법 중 하나로 설치할 수 있어요.
- llama.app 방문해서 설치 안내에 따르기
- Docker로 실행하기 — Docker 문서
- 릴리스 페이지에서 미리 빌드된 바이너리 받기
- 저장소를 클론해서 소스에서 빌드 — 빌드 가이드
모델 실행해 보기
설치가 끝나면 Hugging Face에서 모델을 바로 받아 실행할 수 있어요.
# Hugging Face에서 모델을 받아 바로 실행
llama cli -hf ggml-org/Qwen3.5-0.8B-GGUF
# OpenAI 호환 API 서버 띄우기
llama serve -hf ggml-org/Qwen3.5-0.8B-GGUF
-hf <user>/<model> 형태로 저장소 이름만 지정하면, GGUF 포맷 모델을 자동으로 내려받고 실행해요. llama cli는 터미널에서 대화를, llama serve는 HTTP 서버를 띄워요.
이 프로젝트가 지향하는 것
llama.cpp의 핵심 목표는 LLM(그리고 VLM) 추론을 최소한의 설정으로, 다양한 하드웨어에서 최신 수준의 성능으로 실행하는 거예요.
- 의존성 없는 순수 C/C++ 구현
- Apple Silicon 1급 지원 — ARM NEON, Accelerate, Metal로 최적화
- x86은 AVX, AVX2, AVX512, AMX 지원
- RISC-V는 RVV, ZVFH, ZFH, ZICBOP, ZIHINTPAUSE 지원
- 1.5~8비트 정수 양자화로 더 빠른 추론과 메모리 절약
- NVIDIA GPU용 커스텀 CUDA 커널 (AMD는 HIP, Moore Threads는 MUSA)
- Vulkan, SYCL 백엔드 지원
- GPU 메모리보다 큰 모델을 CPU+GPU 하이브리드로 추론
llama.cpp는 ggml 라이브러리 위에 만들어져요.
더 알아보기
- 빌드하기 — 소스에서 직접 빌드
- 모델 얻기와 양자화 — GGUF 모델 가져오기
- llama-server — OpenAI 호환 HTTP 서버