멀티모달 (이미지·오디오 입력)
멀티모달 (이미지·오디오 입력)
llama.cpp는 libmtmd를 통해 이미지·오디오 같은 멀티모달 입력을 지원해요. 다만 오디오는 아직 실험 단계라 품질이 제한될 수 있어요. 이 기능을 쓰는 도구는 llama-mtmd-cli와 OpenAI 호환 /chat/completions API를 지원하는 llama-server 두 가지가 있어요.
멀티모달 켜기
멀티모달 모델을 로드하는 방법은 두 가지가 있어요.
-hf옵션으로 지원되는 모델 사용 (사전 양자화된 목록은 아래 참고)-hf로 로드하되 멀티모달은 끄려면--no-mmproj-hf로 로드하되 커스텀 mmproj 파일을 쓰려면--mmproj local_file.gguf
-m model.gguf와--mmproj file.gguf로 텍스트 모델과 멀티모달 프로젝터를 각각 지정
기본적으로 멀티모달 프로젝터는 GPU로 오프로드돼요. 끄려면 --no-mmproj-offload를 추가하면 돼요.
# CLI로 간단하게
llama-mtmd-cli -hf ggml-org/gemma-3-4b-it-GGUF
# 서버로 간단하게
llama-server -hf ggml-org/gemma-3-4b-it-GGUF
# 로컬 파일 사용
llama-server -m gemma-3-4b-it-Q4_K_M.gguf --mmproj mmproj-gemma-3-4b-it-Q4_K_M.gguf
# GPU 오프로드 없이
llama-server -hf ggml-org/gemma-3-4b-it-GGUF --no-mmproj-offload
사전 양자화된 모델
바로 쓸 수 있는 모델들은 ggml-org의 Hugging Face 멀티모달 GGUF 컬렉션에서 찾을 수 있어요. 대부분 기본 Q4_K_M 양자화를 제공해요. 아래에서 (tool_name) 자리에 쓰려는 바이너리 이름(llama-mtmd-cli 또는 llama-server)을 넣으면 돼요. 모델에 따라 -c 8192처럼 큰 컨텍스트가 필요할 수도 있어요.
비전 모델:
# Gemma 3
(tool_name) -hf ggml-org/gemma-3-4b-it-GGUF
(tool_name) -hf ggml-org/gemma-3-27b-it-GGUF
# SmolVLM
(tool_name) -hf ggml-org/SmolVLM-Instruct-GGUF
(tool_name) -hf ggml-org/SmolVLM2-2.2B-Instruct-GGUF
# Pixtral 12B
(tool_name) -hf ggml-org/pixtral-12b-GGUF
# Qwen 2.5 VL
(tool_name) -hf ggml-org/Qwen2.5-VL-7B-Instruct-GGUF
# Moondream2 20250414
(tool_name) -hf ggml-org/moondream2-20250414-GGUF
오디오 모델:
# Ultravox 0.5
(tool_name) -hf ggml-org/ultravox-v0_5-llama-3_2-1b-GGUF
# Mistral Voxtral
(tool_name) -hf ggml-org/Voxtral-Mini-3B-2507-GGUF
# Qwen3-ASR
(tool_name) -hf ggml-org/Qwen3-ASR-0.6B-GGUF
혼합 모달 (오디오 + 비전):
# Qwen2.5 Omni
(tool_name) -hf ggml-org/Qwen2.5-Omni-3B-GGUF
# Qwen3 Omni
(tool_name) -hf ggml-org/Qwen3-Omni-30B-A3B-Instruct-GGUF
더 많은 비전 기능 모델은 Hugging Face의 image-text-to-text 파이프라인 검색에서 GGUF를 찾아볼 수 있어요.
더 알아보기
- llama-server — OpenAI 호환 API
- 모델 얻기와 양자화 — GGUF 모델 가져오기