MiniCPM-V 2.6 모델 카드
MiniCPM-V 2.6 모델 카드
MiniCPM-V 2.6은 시리즈에서 단일·멀티 이미지와 영상 이해를 모두 다루는 모델이에요. SigLip-400M + Qwen2-7B 기반으로 총 8B 파라미터를 가져요.
단일 이미지 이해에서 GPT-4o mini, GPT-4V, Gemini 1.5 Pro, Claude 3.5 Sonnet 같은 상용 모델을 뛰어넘는 성능을 보여줘요. 특히 토큰 밀도(픽셀당 인코딩 토큰 수)가 뛰어나서 1.8M 픽셀 이미지를 처리할 때 640 토큰만 만들어요 — 대부분 모델보다 75% 적은 수치예요.
주요 특징
- 단일 이미지: GPT-4o mini·GPT-4V·Gemini 1.5 Pro·Claude 3.5 Sonnet 능가.
- 멀티 이미지·인컨텍스트 러닝: 여러 이미지에 걸쳐 대화·추론.
- 영상 이해: Video-MME에서 GPT-4V·Claude 3.5 Sonnet·LLaVA-NeXT-Video-34B 능가.
- 낮은 환각률: RLAIF-V·VisCPM 기반으로 Object HalBench에서 GPT-4o/GPT-4V보다 신뢰성 높음.
- 다국어: 영어·중국어·독일어·프랑스어·이탈리아어·한국어 등 지원.
사용 예시 (Transformers)
import torch
from PIL import Image
from transformers import AutoModel, AutoTokenizer
model = AutoModel.from_pretrained(
'openbmb/MiniCPM-V-2_6',
trust_remote_code=True,
attn_implementation='sdpa', # sdpa 또는 flash_attention_2, eager는 제외
torch_dtype=torch.bfloat16,
)
model = model.eval().cuda()
tokenizer = AutoTokenizer.from_pretrained('openbmb/MiniCPM-V-2_6', trust_remote_code=True)
image = Image.open('xx.jpg').convert('RGB')
question = 'What is in the image?'
msgs = [{'role': 'user', 'content': [image, question]}]
res = model.chat(
image=None,
msgs=msgs,
tokenizer=tokenizer,
)
배포 옵션
- llama.cpp·Ollama(로컬 CPU 추론), int4·GGUF 양자화(16종), vLLM(고처리량·효율적 추론) 지원.
- 도메인 특화 파인튜닝도 가능해요.