llama.cpp
llama.cpp
llama.cpp는 Meta의 LLaMA를 시작으로 대형 언어 모델(LLM)을 순수 C/C++로 구현한 오픈소스 추론 엔진이에요. 가볍고 의존성이 적어서 로컬 환경은 물론 PC, 노트북에서도 모델을 직접 실행할 수 있고, 사실상 로컬 실행 기준(오픈소스 추론)의 사실 표준 역할을 해요.
핵심 특징
- 순수 C/C++ 구현: Python 없이도 동작, 최소 의존성으로 빌드
- GGUF 포맷: 모델을 단일 파일로 양자화·배포하는 표준 형식
- 양자화 지원:
q4_0,q8_0,IQ등 가중치를 줄여 메모리·연산 절감 - llama-server: OpenAI 호환 HTTP API로 로컬 추론 서빙
- 멀티모달:
mmproj(LLaVA 등)로 이미지·비전 입력 처리
이 카테고리의 문서
- 시작: 빌드, 설치, 첫 실행
- 추론: llama-cli 실행, 샘플링 파라미터
- 양자화: GGUF 변환, 양자화 타입
- 서빙: llama-server, OpenAI 호환 API
- 멀티모달: mmproj 프로젝션, 비전 모델