MiniCPM-V 2.6 모델 카드

MiniCPM-V 2.6 모델 카드

MiniCPM-V 2.6은 시리즈에서 단일·멀티 이미지와 영상 이해를 모두 다루는 모델이에요. SigLip-400M + Qwen2-7B 기반으로 총 8B 파라미터를 가져요.

단일 이미지 이해에서 GPT-4o mini, GPT-4V, Gemini 1.5 Pro, Claude 3.5 Sonnet 같은 상용 모델을 뛰어넘는 성능을 보여줘요. 특히 토큰 밀도(픽셀당 인코딩 토큰 수)가 뛰어나서 1.8M 픽셀 이미지를 처리할 때 640 토큰만 만들어요 — 대부분 모델보다 75% 적은 수치예요.

출처: https://huggingface.co/openbmb/MiniCPM-V-2_6

주요 특징

  • 단일 이미지: GPT-4o mini·GPT-4V·Gemini 1.5 Pro·Claude 3.5 Sonnet 능가.
  • 멀티 이미지·인컨텍스트 러닝: 여러 이미지에 걸쳐 대화·추론.
  • 영상 이해: Video-MME에서 GPT-4V·Claude 3.5 Sonnet·LLaVA-NeXT-Video-34B 능가.
  • 낮은 환각률: RLAIF-V·VisCPM 기반으로 Object HalBench에서 GPT-4o/GPT-4V보다 신뢰성 높음.
  • 다국어: 영어·중국어·독일어·프랑스어·이탈리아어·한국어 등 지원.

사용 예시 (Transformers)

import torch
from PIL import Image
from transformers import AutoModel, AutoTokenizer

model = AutoModel.from_pretrained(
    'openbmb/MiniCPM-V-2_6',
    trust_remote_code=True,
    attn_implementation='sdpa',  # sdpa 또는 flash_attention_2, eager는 제외
    torch_dtype=torch.bfloat16,
)
model = model.eval().cuda()
tokenizer = AutoTokenizer.from_pretrained('openbmb/MiniCPM-V-2_6', trust_remote_code=True)

image = Image.open('xx.jpg').convert('RGB')
question = 'What is in the image?'
msgs = [{'role': 'user', 'content': [image, question]}]

res = model.chat(
    image=None,
    msgs=msgs,
    tokenizer=tokenizer,
)

배포 옵션

  • llama.cpp·Ollama(로컬 CPU 추론), int4·GGUF 양자화(16종), vLLM(고처리량·효율적 추론) 지원.
  • 도메인 특화 파인튜닝도 가능해요.

더 알아보기