멀티모달 (이미지·오디오 입력)

멀티모달 (이미지·오디오 입력)

llama.cpp는 libmtmd를 통해 이미지·오디오 같은 멀티모달 입력을 지원해요. 다만 오디오는 아직 실험 단계라 품질이 제한될 수 있어요. 이 기능을 쓰는 도구는 llama-mtmd-cli와 OpenAI 호환 /chat/completions API를 지원하는 llama-server 두 가지가 있어요.

출처: llama.cpp multimodal 문서

멀티모달 켜기

멀티모달 모델을 로드하는 방법은 두 가지가 있어요.

  • -hf 옵션으로 지원되는 모델 사용 (사전 양자화된 목록은 아래 참고)
    • -hf로 로드하되 멀티모달은 끄려면 --no-mmproj
    • -hf로 로드하되 커스텀 mmproj 파일을 쓰려면 --mmproj local_file.gguf
  • -m model.gguf--mmproj file.gguf로 텍스트 모델과 멀티모달 프로젝터를 각각 지정

기본적으로 멀티모달 프로젝터는 GPU로 오프로드돼요. 끄려면 --no-mmproj-offload를 추가하면 돼요.

# CLI로 간단하게
llama-mtmd-cli -hf ggml-org/gemma-3-4b-it-GGUF

# 서버로 간단하게
llama-server -hf ggml-org/gemma-3-4b-it-GGUF

# 로컬 파일 사용
llama-server -m gemma-3-4b-it-Q4_K_M.gguf --mmproj mmproj-gemma-3-4b-it-Q4_K_M.gguf

# GPU 오프로드 없이
llama-server -hf ggml-org/gemma-3-4b-it-GGUF --no-mmproj-offload

사전 양자화된 모델

바로 쓸 수 있는 모델들은 ggml-org의 Hugging Face 멀티모달 GGUF 컬렉션에서 찾을 수 있어요. 대부분 기본 Q4_K_M 양자화를 제공해요. 아래에서 (tool_name) 자리에 쓰려는 바이너리 이름(llama-mtmd-cli 또는 llama-server)을 넣으면 돼요. 모델에 따라 -c 8192처럼 큰 컨텍스트가 필요할 수도 있어요.

비전 모델:

# Gemma 3
(tool_name) -hf ggml-org/gemma-3-4b-it-GGUF
(tool_name) -hf ggml-org/gemma-3-27b-it-GGUF

# SmolVLM
(tool_name) -hf ggml-org/SmolVLM-Instruct-GGUF
(tool_name) -hf ggml-org/SmolVLM2-2.2B-Instruct-GGUF

# Pixtral 12B
(tool_name) -hf ggml-org/pixtral-12b-GGUF

# Qwen 2.5 VL
(tool_name) -hf ggml-org/Qwen2.5-VL-7B-Instruct-GGUF

# Moondream2 20250414
(tool_name) -hf ggml-org/moondream2-20250414-GGUF

오디오 모델:

# Ultravox 0.5
(tool_name) -hf ggml-org/ultravox-v0_5-llama-3_2-1b-GGUF

# Mistral Voxtral
(tool_name) -hf ggml-org/Voxtral-Mini-3B-2507-GGUF

# Qwen3-ASR
(tool_name) -hf ggml-org/Qwen3-ASR-0.6B-GGUF

혼합 모달 (오디오 + 비전):

# Qwen2.5 Omni
(tool_name) -hf ggml-org/Qwen2.5-Omni-3B-GGUF

# Qwen3 Omni
(tool_name) -hf ggml-org/Qwen3-Omni-30B-A3B-Instruct-GGUF

더 많은 비전 기능 모델은 Hugging Face의 image-text-to-text 파이프라인 검색에서 GGUF를 찾아볼 수 있어요.

더 알아보기