Falcon2-11B-VLM 모델 카드

Falcon2-11B-VLM 모델 카드

이미지를 "읽고" 설명할 수 있는 비전-언어 모델이 필요하다면 Falcon2-11B-VLM 을 봐요. Falcon2-11B 채팅 모델에 CLIP ViT-L/14 비전 인코더를 결합해, 이미지·텍스트 데이터로 훈련한 VLM 이에요.

출처: https://huggingface.co/tiiuae/falcon-11B-vlm

구성

  • 파라미터: 11B
  • 비전 인코더: 사전학습된 CLIP ViT-L/14
  • 훈련 데이터: 5,000B+ 토큰 기반 + 이미지-텍스트 데이터
  • 장점: 이미지 속 작은 물체의 미세한 디테일 인식을 위한 고해상도 동적 인코딩

시작하기

from transformers import AutoProcessor, LlavaNextForConditionalGeneration
import torch, requests
from PIL import Image

model = LlavaNextForConditionalGeneration.from_pretrained(
    "tiiuae/falcon-11B-vlm", torch_dtype=torch.bfloat16
)
processor = AutoProcessor.from_pretrained("tiiuae/falcon-11B-vlm")

이미지 입력에선 User:<image> {instruction} Falcon: 같은 프롬프트 형식을 쓰는 걸 볼 수 있어요.

훈련 과정

  • 1단계(사전학습): LLM 은 고정, 멀티모달 프로젝터만 558K 이미지-캡션 쌍으로 학습
  • 2단계(파인튜닝): 프로젝터+LLM 을 1.2M 이미지-텍스트 지시 데이터로 학습 (멀티턴 대화 포함)

더 알아보기