llama.cpp

llama.cpp

llama.cpp는 Meta의 LLaMA를 시작으로 대형 언어 모델(LLM)을 순수 C/C++로 구현한 오픈소스 추론 엔진이에요. 가볍고 의존성이 적어서 로컬 환경은 물론 PC, 노트북에서도 모델을 직접 실행할 수 있고, 사실상 로컬 실행 기준(오픈소스 추론)의 사실 표준 역할을 해요.

핵심 특징

  • 순수 C/C++ 구현: Python 없이도 동작, 최소 의존성으로 빌드
  • GGUF 포맷: 모델을 단일 파일로 양자화·배포하는 표준 형식
  • 양자화 지원: q4_0, q8_0, IQ 등 가중치를 줄여 메모리·연산 절감
  • llama-server: OpenAI 호환 HTTP API로 로컬 추론 서빙
  • 멀티모달: mmproj(LLaVA 등)로 이미지·비전 입력 처리

이 카테고리의 문서

  • 시작: 빌드, 설치, 첫 실행
  • 추론: llama-cli 실행, 샘플링 파라미터
  • 양자화: GGUF 변환, 양자화 타입
  • 서빙: llama-server, OpenAI 호환 API
  • 멀티모달: mmproj 프로젝션, 비전 모델

출처: https://github.com/ggml-org/llama.cpp